№ 90
Safety Sentinel là nền tảng phân tích dữ liệu mô phỏng xe tự hành, giúp phát hiện các sự kiện an toàn, so sánh kết quả giữa các phiên bản mô hình và hỗ trợ chuyên gia đưa ra quyết định dựa trên bằng chứng.
Nền tảng phân tích và đánh giá an toàn cho mô hình xe tự hành trong môi trường mô phỏng.
Phát triển xe tự hành là một vòng lặp liên tục: huấn luyện mô hình, chạy mô phỏng, phân tích kết quả, rồi lại cải thiện. Nhưng chính giai đoạn phân tích — khâu quyết định mô hình nào đủ an toàn để tiến lên bước tiếp theo — lại đang là nút thắt lớn nhất.
Khối lượng dữ liệu vượt khả năng xử lý thủ công. Mỗi lần chạy mô phỏng với CARLA sinh ra hàng trăm kịch bản, mỗi kịch bản là một luồng telemetry dày đặc ghi lại vị trí, tốc độ, góc lái, trạng thái phanh và hàng chục tín hiệu khác theo từng frame. Kỹ sư buộc phải mở từng file thủ công để tìm kiếm các sự kiện nguy hiểm — lệch làn, phanh gấp, mất kiểm soát, nguy cơ va chạm — trong khi mỗi một lần chạy có thể lên đến hàng nghìn frame dữ liệu.
Không có chuẩn thống nhất để so sánh mô hình. Khi nhóm nghiên cứu cần đánh giá xem VAD hay UniAD lái an toàn hơn, câu trả lời không thể đơn giản là "mô hình nào ít lỗi hơn". Hai mô hình phải được đánh giá trên đúng cùng một bộ kịch bản, cùng cấu hình môi trường, và kết quả phải được tổng hợp theo cùng một phương pháp. Nếu bất kỳ điều kiện nào không đồng nhất, kết luận sẽ thiếu căn cứ — và trong lĩnh vực an toàn, kết luận sai còn nguy hiểm hơn là không có kết luận.
Quyết định an toàn thiếu truy vết. Ngay cả khi kỹ sư phát hiện được một sự kiện đáng ngờ, không có hệ thống nào ghi lại: ai đã xem xét, bằng chứng nào được dùng, và quyết định cuối cùng là gì. Điều này khiến quá trình kiểm toán (audit) sau này gần như không thể thực hiện được.
Nhóm phát triển một hệ thống tự động hóa việc phát hiện sự kiện, đảm bảo tính công bằng khi so sánh giữa các mô hình, và ghi lại toàn bộ quá trình đánh giá một cách minh bạch và có thể kiểm chứng.
Safety Sentinel là nền tảng web chuyên biệt giúp tự động hóa quá trình phân tích dữ liệu mô phỏng xe tự hành, từ việc tiếp nhận log thô cho đến hỗ trợ ra quyết định an toàn có truy vết.
Kỹ sư tải lên file ZIP kết xuất từ CARLA — chứa dữ liệu toàn bộ telemetry của lần chạy — và hệ thống lập tức tạo một job xử lý nền. Toàn bộ pipeline được thiết kế theo cơ chế streaming trong bộ nhớ giới hạn, đảm bảo hoạt động ổn định ngay cả với archive dung lượng lớn.
| Pha | Thành phần | Mô tả |
|---|---|---|
| Pha 1 | Chuẩn hóa dữ liệu | Đọc từng file zip theo cơ chế streaming, trích xuất và lưu trữ có cấu trúc toàn bộ dữ liệu: frames telemetry, thông tin actors, biển báo dừng và sự kiện chuyển quyền điều khiển. Hệ thống sinh ra báo cáo schema để kiểm tra tính đầy đủ của dữ liệu đầu vào. |
| Pha 2 | Phát hiện sự kiện an toàn | Áp dụng bộ detector lên đúng những trường telemetry thực sự có trong dữ liệu, bao gồm: lệch làn đường, phanh gấp, nguy cơ va chạm theo thời gian (TTC), lệch lộ trình, vi phạm biển báo và sự kiện can thiệp điều khiển. |
| Pha 3 | Tổng hợp chỉ số | Tính toán các metrics tổng hợp cho từng lần chạy: tổng số sự kiện, quãng đường mô phỏng, tần suất sự kiện trên 1.000 km và các cảnh báo về chất lượng dữ liệu. Kết quả được lưu trữ bền vững làm cơ sở cho việc so sánh sau này. |
⚠️ Một nguyên tắc cứng của hệ thống là không suy diễn hay bịa đặt sự kiện khi tín hiệu telemetry tương ứng không tồn tại trong dữ liệu — các chỉ số thiếu được ghi rõ là "không đủ dữ liệu" thay vì hiển thị giá trị 0.
Sau khi hai mô hình (ví dụ VAD và UniAD) đã được xử lý riêng biệt, hệ thống cho phép so sánh trực tiếp kết quả của hai mô hình trên cùng một bộ kịch bản. Trước khi thực hiện so sánh, hệ thống tự động kiểm tra tính tương đương: hai mô hình phải được chạy trên cùng scenario_id suite và cả hai đều phải parse thành công. Nếu điều kiện không thỏa mãn, hệ thống trả về lý do cụ thể thay vì đưa ra kết quả không có căn cứ.
Kết quả so sánh bao gồm delta về số lượng sự kiện, tần suất sự kiện và mức độ nghiêm trọng, kèm cờ cảnh báo khi mô hình mới có dấu hiệu hồi quy về an toàn.
Những sự kiện đáng ngờ được chuyển đến Safety Reviewer — người duy nhất có quyền phê duyệt hoặc bác bỏ kết quả đánh giá. Mọi quyết định đều được ghi vào nhật ký kiểm toán (audit log) bất biến, lưu lại thông tin: ai quyết định, dựa trên bằng chứng nào và vào thời điểm nào. Trước khi Reviewer có thể ra quyết định cấp độ mô hình, một cổng QA tự động sẽ xác nhận dữ liệu đã được xử lý đầy đủ và schema hợp lệ.
🧑⚖️ Hệ thống không tự động cấp chứng nhận an toàn. Safety Sentinel đóng vai trò là nền tảng cung cấp bằng chứng minh bạch và có thể truy vết — quyết định cuối cùng luôn thuộc về con người.
Safety Sentinel biến quá trình phân tích log từ công việc thủ công hàng giờ thành một quy trình tự động, chuẩn hóa và có thể kiểm toán — giúp đội ngũ tập trung vào điều quan trọng nhất: đưa ra quyết định an toàn dựa trên bằng chứng thực tế.
Safety Sentinel không phải là một thiết kế trên giấy — hệ thống đã được triển khai và đang chạy đầy đủ, với backend, frontend và toàn bộ pipeline phân tích hoạt động ổn định trong môi trường local và Docker.
Frontend xây dựng bằng React, TypeScript và Vite, cung cấp dashboard trực quan cho cả ba nhóm người dùng. Backend sử dụng FastAPI và Python 3.11, đảm nhiệm toàn bộ xử lý nghiệp vụ và REST API. Redis điều phối job xử lý nền; SQLite lưu trữ bền vững users, sessions, datasets và nhật ký kiểm toán. Toàn bộ stack được đóng gói bằng Docker Compose, sẵn sàng cho demo và triển khai thực tế.
Hệ thống có ba vai trò:
| Vai trò | Quyền |
|---|---|
| Simulation Engineer | Có quyền upload dữ liệu và theo dõi kết quả |
| Safety Reviewer | Có quyền xem xét sự kiện, so sánh mô hình và đưa ra phê duyệt |
| Administrator | Quản lý người dùng, cấu hình hệ thống và giám sát sức khỏe pipeline |
Một cổng QA tự động kiểm tra tính hợp lệ của dữ liệu trước khi Reviewer có thể ra quyết định, đảm bảo mọi phê duyệt đều dựa trên dữ liệu đã được xác nhận đầy đủ.
120+ automated test cases
Bao phủ routing, authentication, pipeline và persistence.
7 Golden dataset cases
Kiểm tra tính xác định của pipeline trên các kịch bản từ lệch làn, phanh gấp, chuyển quyền điều khiển cho đến lái xe hoàn toàn an toàn.
5 manual acceptance test cases
Xác nhận các luồng nghiệp vụ cốt lõi theo góc độ người dùng thực tế.
Ngoài ra, CI/CD với GitHub Actions tự động chạy lint, test và build frontend mỗi khi có thay đổi.
Với nền tảng kỹ thuật đã vận hành ổn định, Safety Sentinel sẵn sàng mở rộng tính năng mà không cần thay đổi kiến trúc cốt lõi.
Safety Sentinel được xây dựng với kiến trúc module hóa, cho phép mở rộng tính năng mà không cần thay đổi nền tảng cốt lõi. Các hướng phát triển được ưu tiên theo thứ tự giá trị thực tế mang lại cho quy trình đánh giá an toàn.
Hệ thống hiện phát hiện 6 loại sự kiện cốt lõi. Trong tương lai, bộ detector có thể bổ sung: gần va chạm theo góc mù, vi phạm đèn đỏ, không nhường đường tại giao lộ, không dừng ở biển báo Stop và các hành vi bất thường chưa có trong bộ kịch bản chuẩn. Mỗi detector mới được thêm vào mà không làm thay đổi kết quả của các detector hiện có.
Hệ thống có thể bổ sung kiểm tra tự động về tính tương đương cấu hình và seed giữa hai mô hình trước khi cho phép so sánh, cùng với dashboard theo dõi xu hướng chất lượng qua nhiều phiên bản liên tiếp. Điều này giúp đội ngũ phát hiện sớm chiều hướng hồi quy trước khi nó trở thành vấn đề nghiêm trọng.
Mỗi khi có phiên bản mô hình mới được huấn luyện, pipeline có thể tự động trigger: chạy mô phỏng, upload kết quả lên Safety Sentinel, phân tích và tạo báo cáo so sánh với phiên bản trước — đưa Safety Sentinel thành một cổng kiểm soát chất lượng tự động trong vòng lặp phát triển.
Adapter S3/R2 đã có sẵn trong kiến trúc hiện tại, sẵn sàng kích hoạt khi cần lưu trữ đám mây cho archive dung lượng lớn. Xử lý song song nhiều job có thể được bổ sung để giảm thời gian chờ khi nhiều kỹ sư upload đồng thời.
Về dài hạn, AI có thể hỗ trợ: tóm tắt tự động các lần chạy dài, phân nhóm các sự kiện tương tự để giảm tải cho Reviewer, ưu tiên các trường hợp nghiêm trọng cần xem xét trước và gợi ý nguyên nhân có thể dẫn đến sự kiện. Mọi gợi ý của AI vẫn cần Safety Reviewer xác nhận — hệ thống không thay thế quyết định của con người.
Safety Sentinel hướng đến trở thành hạ tầng đánh giá an toàn tiêu chuẩn cho các nhóm nghiên cứu và phát triển xe tự hành — nơi mọi quyết định đều có căn cứ, mọi bằng chứng đều có thể truy vết.