№ 09
SceneSearch là công cụ tìm kiếm hình ảnh và video lái xe bằng ngôn ngữ tự nhiên, giúp kỹ sư nhanh chóng tìm lại các cảnh phù hợp trong kho dữ liệu lớn. Hệ thống còn tích hợp AI chatbot để tối ưu truy vấn, phân tích kết quả và cải thiện tìm kiếm dựa trên feedback người dùng.
#Seek – Semantic Video Retrieval
Seek là hệ thống tìm kiếm ngữ nghĩa cho dữ liệu hình ảnh và video lái xe, giúp kỹ sư tìm nhanh các cảnh mong muốn bằng ngôn ngữ tự nhiên thay vì phải tìm thủ công trong kho dữ liệu lớn.
Hệ thống gồm hai pipeline chính:
Offline Ingestion: Video được lưu trên MinIO và sampling ở 2 frames/second. Các frame được xử lý qua bước deduplication với ngưỡng similarity 0.95 để loại bỏ những frame quá giống nhau. Sau đó, Qwen3-VL Embedding 2B tạo vector phục vụ retrieval, trong khi Qwen3-VL sinh metadata như scene, traffic, road, OCR, caption và retrieval tags. Embedding được lưu trên Qdrant, metadata được lưu cùng payload.
Online Search: Người dùng nhập query bằng ngôn ngữ tự nhiên. Query được embedding và tìm kiếm trên Qdrant để lấy các frame phù hợp nhất. Người dùng có thể xem preview, timestamp và metadata, đồng thời lọc và sắp xếp lại kết quả.
Nhóm benchmark SigCLIP, Qwen3-VL Embedding 2B và Hybrid Retrieval trên frame-level retrieval, sử dụng Hit@K và MRR.
Trong thử nghiệm, Qwen3-VL Embedding 2B đạt 37.50% Hit@1, 81.82% Hit@10, 92.05% Hit@50 và 0.5188 MRR, cho kết quả phù hợp hơn với driving data so với các phương pháp còn lại.
Ngoài semantic search, Seek còn có định hướng AI chatbot để viết lại query, phân tích kết quả và hỗ trợ người dùng tìm kiếm tự nhiên hơn. Feedback từ người dùng được sử dụng làm cơ sở cho việc cải thiện retrieval trong tương lai.