Đang chạy mực qua máy in — từng lớp màu một, kiên nhẫn nhé!
№ 01
№ 02
№ 03
№ 04
№ 05
№ 06
PlanBench · AI·20K Demo Day Zine
№ 81
PlanBench
Nền tảng mô phỏng cho phép các thuật toán ứng viên chạy trên cùng một thế giới, cùng seed, cùng vật cản động, từ đó hệ thống đưa ra đúng một thuật toán khuyến nghị kèm khoảng tin cậy và bằng chứng phát lại được.
Fig. 01 · Ảnh dự án
Bài toán
Chọn thuật toán điều hướng cho một kho cụ thể là quyết định tốn kém và khó rút
lại, nhưng phần lớn cơ sở để chọn lại đến từ những thứ không so được với nhau:
một con số trong paper chạy trên map khác, một lần demo may mắn, một bảng
benchmark không nói nó chạy bao nhiêu lần.
Đo trên robot thật thì đắt, chậm và không lặp lại được — mỗi lượt tốn hàng chục
phút, cần robot rảnh và kho trống, và tình huống vừa hỏng thì không dựng lại
được. Ngay cả khi đã đo, phép so vẫn hỏng theo ba cách: không cùng điều kiện,
không đủ số lần chạy, và kết luận nghe mạnh hơn dữ liệu.
Giải pháp
PlanBench là tầng ra quyết định đứng trên một nền giao thức đánh giá công
bằng. Người dùng khai một triển khai — map, robot, cảm biến và nhiễu, mission,
vật cản động, ngưỡng khả thi, trọng số mục tiêu — rồi hệ thống chấm các ứng viên
trên đúng thế giới đó và chỉ ra cái đáng dùng nhất.
Bốn nguyên tắc kỹ thuật:
Công bằng đo được, không phải hứa. Cùng map, cùng scenario, cùng seed,
cùng vật cản động ở cùng thời điểm — mỗi điều kiện mang checksum. Episode
ghép cặp theo episode_context, hiệu số tính theo từng cặp chứ không giữa
hai trung bình rời nhau.
Cổng tách khỏi điểm số. Sáu cổng khả thi G1–G6 chạy trước mọi phép chấm
điểm và cả sáu luôn chạy: chấm điểm trả lời "cái nào tốt hơn", cổng trả lời
"cái này có được xét không". Một stack va chạm không được cứu bằng việc nó nhanh.
Kết luận không vượt quá bằng chứng. Mọi con số đi kèm khoảng tin cậy 95%
bootstrap và số episode đứng sau. Khoảng tin cậy vắt qua 0 thì thẻ quyết định
nói thẳng là run này không chứng minh được chênh lệch nó báo. Có một danh sách
chữ hệ thống không được phép nói, kèm hàm kiểm và test CI canh.
Nói được vì sao, không chỉ ai thắng. Thang bằng chứng bốn mức
(observed → associated → mechanism_verified → intervention_supported),
không có mức thứ năm cho "không biết" — thiếu bằng chứng nghĩa là không có claim.
Các tính năng trong bản MVP
Triển khai — khai thế giới cần đo bằng form hoặc YAML; không một ngưỡng nào
viết cứng trong code.
Sân thử — chạy thử một episode, xem quỹ đạo, clearance, latency planner
theo thời gian thực trước khi phóng phép so dài.
Quyết định — phép so ghép cặp giữa hai ứng viên. Stack đã đăng ký:
astar+dwa, astar+dwa_predictive, rrtstar+dwa, rrtstar+dwa_predictive,
, , .
§
Phụ lục — Demo & Slides
Video demo
Bản demo trực tiếp
Slide trình bày
astar+pure_pursuit
rrtstar+pure_pursuit
astar+ppo
Thẻ quyết định — ΔU ghép cặp + CI 95%, phân rã theo từng mục tiêu, bảng cổng
kèm bằng chứng loại, và "nên triển khai cái nào" theo ba tình huống ưu tiên.
Tầng giải thích — waterfall ΔU, phát lại hai canvas cùng playhead, chọn
exemplar theo công thức cố định, sáu detector (detour, stuck_cluster,
replan_storm, oscillation, latency_spike, near_miss_cluster),
16 tool card và 4 mechanism checker.
Lớp AI — trợ lý hội thoại đọc bản ghi qua 11 tool chỉ-đọc, và lớp cố vấn
xếp lại thứ tự advice luật rồi thêm tối đa 3 ý. Model không xoá được thứ bộ luật
đã nói, không sinh ra con số, không duyệt gì. Bốn luật ràng buộc đều có test đã
được chứng minh là bắt được lỗi thật bằng cách tiêm lỗi vào rồi đòi nó đỏ.
Cắm thuật toán của bạn vào — Algorithm Host + plugin SDK, lane subprocess
cho code chưa tin được, CLI kiểm tính tuân thủ trước khi chạy thật; kho model
PPO kiểm checksum và tương thích robot profile.
Xuất và chia sẻ — Markdown và Excel, hai thứ tiếng, mở đầu bằng trang
Summary; trace và artifact lưu ngoài database kèm checksum để một lượt chạy
được phát lại chứ không chỉ được thuật lại.
Nền tảng — đăng nhập Google/GitHub, quy trình duyệt tùy chọn, bản đồ vẽ tay
có phiên bản, thư viện kịch bản dựng sẵn, giao diện Việt/Anh + sáng/tối.
Tính khả thi
Chạy được ngay: web app đã deploy công khai (https://planbench-web.onrender.com/),
kèm bản desktop đóng gói sẵn cho Windows có installer và cơ chế cập nhật.
Stack: FastAPI + WebSocket, Pydantic làm nguồn sự thật của domain, NumPy/SciPy cho
tầng mô phỏng và thống kê, Next.js + React cho giao diện, SQLite mặc định và
PostgreSQL + Alembic khi cần, Docker Compose.
Toàn bộ chỉ mô phỏng — không điều khiển robot thật, không dùng Gazebo. Kiến trúc
để mở đường lên ROS2/Nav2.
Hướng phát triển
Nâng phạm vi tuyên bố: từ mission-level (1 map + 1 cặp start/goal) lên
deployment-level (phân bố nhiệm vụ có xác suất) và robust deployment (kiểm độ bền
của khuyến nghị trước sai số dữ liệu đầu vào).
Đo công tinh chỉnh như chi phí thật — số trial đã dùng, wall-clock, đường cong
bão hòa trials_to_90.
Sàng lọc trên đích — hiện G4/G5 chạy trên host, hỏng thì chắc chắn hỏng trên
bo mạch đích nhưng đạt thì chưa chứng minh được gì; bước tiếp là đo trên chính
phần cứng triển khai.
Đích xa: một đội robot mới, chưa biết gì về nền tảng, khai thế giới của họ
trong một buổi chiều, cắm hai thuật toán vào, và ra về với một tài liệu mà quản lý
của họ đọc hiểu được.