№ 99
Trợ lý VLM hỗ trợ kỹ sư phân tích sự cố xe tự hành từ video và telemetry, liên kết bằng chứng theo thời gian và tạo báo cáo có cấu trúc để review nhanh, dễ kiểm chứng hơn.
Trong quá trình vận hành và kiểm thử xe tự hành/ADAS, hệ thống xe tự lái liên tục tạo ra nhiều nguồn dữ liệu như video hành trình và telemetry của xe. Khi xuất hiện một phiên bất thường, disengagement hoặc sự cố, kỹ sư phải quay lại các nguồn dữ liệu này để xác định điều gì đã xảy ra trước, trong và sau sự kiện.
Quy trình review thủ công thường bao gồm xem và tua lại video nhiều lần, xác định timestamp, đối chiếu telemetry, ghi chú diễn biến và tổng hợp thành báo cáo. Không chỉ tốn thời gian, quá trình này còn tạo ra nhiều thao tác lặp lại, chuyển đổi context giữa các nguồn dữ liệu và phụ thuộc nhiều vào khả năng quan sát, ghi nhớ của người review.
VLens là trợ lý VLM hỗ trợ kỹ sư phân tích và review sự cố xe tự hành từ video và telemetry.
Hệ thống tập trung vào ba nhiệm vụ chính:
VLens không thay thế kỹ sư đưa ra kết luận cuối cùng. AI hỗ trợ xử lý và tổng hợp dữ liệu ban đầu, trong khi kỹ sư vẫn giữ vai trò kiểm chứng và quyết định kết quả.
Video + Telemetry → VLens → Observation + Evidence + Timeline → Engineer Review → Structured Report
Thay vì bắt đầu từ dữ liệu thô, kỹ sư nhận được các observation và evidence đã được tổ chức theo timeline để tập trung vào quá trình kiểm chứng và hoàn thiện báo cáo.
MVP hiện được đánh giá trên 12 video thuộc 5 scenario classes:
Ground Truth của từng video được xây dựng thủ công trước khi đối chiếu với output của VLens và được lưu trong ground_truth.json.
Mỗi Ground Truth gồm:
is_incident — xác định video có xảy ra sự cố hay không.incident_type — xác định loại sự cố thực tế.timeline — mô tả các mốc thời gian và diễn biến chính của sự kiện.evaluation_events — các sự kiện quan trọng được sử dụng làm dữ liệu tham chiếu để đánh giá output.Evaluation được thực hiện theo hai tầng:
1. Incident Detection
Đánh giá VLens có xác định đúng video có sự cố hay không có sự cố dựa trên Ground Truth is_incident.
2. Incident Classification
Với các video có sự cố, đánh giá VLens có phân loại đúng incident_type hay không giữa:
vehicle_collision • crossing_collision • pedestrian_collision • environment_collision
Các prediction của VLens được đối chiếu với Ground Truth để đánh giá bằng các metric:
Precision — trong các sự kiện mà VLens dự đoán, đo tỷ lệ prediction thực sự đúng so với Ground Truth. Precision cao cho thấy hệ thống tạo ra ít False Positive.
Recall — trong các sự kiện thực sự tồn tại trong Ground Truth, đo tỷ lệ sự kiện mà VLens phát hiện được. Recall cao cho thấy hệ thống ít bỏ sót sự kiện.
F1-score — trung bình điều hòa giữa Precision và Recall, dùng để đánh giá sự cân bằng giữa khả năng phát hiện đúng và hạn chế bỏ sót hoặc dự đoán sai.
Ngoài khả năng phát hiện và phân loại sự cố, VLens còn được đánh giá về khả năng xác định đúng thời điểm và khoảng thời gian xảy ra sự kiện thông qua:
Median t0 Error — đo sai lệch giữa thời điểm bắt đầu sự kiện (t0) mà VLens dự đoán và thời điểm bắt đầu được xác định trong Ground Truth. Sai số được tính theo giây cho từng sự kiện và lấy giá trị median trên tập evaluation. Giá trị càng thấp càng tốt.
t0 Error = |t0_pred − t0_GT|
Temporal IoU (Intersection over Union) — đo mức độ chồng lấp giữa khoảng thời gian sự kiện VLens dự đoán và khoảng thời gian sự kiện trong Ground Truth.
Temporal IoU = Intersection(predicted interval, GT interval) / Union(predicted interval, GT interval)
Temporal IoU nằm trong khoảng 0–1; giá trị càng gần 1 cho thấy VLens xác định khoảng thời gian diễn ra sự kiện càng sát với Ground Truth.
Như vậy, evaluation của MVP xem xét hai khía cạnh:
Event Detection & Classification → Precision • Recall • F1-score
Temporal Grounding → Median t0 Error • Temporal IoU
Do tập đánh giá hiện tại gồm 12 video, các kết quả được xem là Preliminary MVP Evaluation, nhằm kiểm chứng pipeline, khả năng nhận diện sự cố và khả năng grounding output của VLens theo timeline trước khi mở rộng sang dataset và benchmark có quy mô lớn hơn.