№ 73
Fleet Miner là hệ thống Active Learning Data Mining giúp tự động tìm và xếp hạng những frame có giá trị gán nhãn cao nhất từ lượng lớn dữ liệu fleet. Hệ thống kết hợp độ bất định của mô hình, độ mới, độ hiếm và độ đa dạng, sau đó đưa ra batch Top-K có thể giải thích và được con người review trước khi bàn giao cho quy trình gán nhãn.
Trong các hệ thống perception, lượng ảnh/frame thu thập từ fleet có thể lớn hơn rất nhiều so với ngân sách gán nhãn. Việc chọn ngẫu nhiên hoặc review thủ công dễ lãng phí ngân sách vào các frame gần giống nhau, đồng thời bỏ sót corner case và những tình huống hiếm nhưng có giá trị cao cho việc cải thiện mô hình.
Fleet Miner giải quyết bài toán này bằng một pipeline Active Learning end-to-end, với nguyên tắc “AI đề xuất — con người quyết định”. Hệ thống tiếp nhận dataset fleet, kiểm tra và phân chia dữ liệu, chạy mô hình perception, tạo embedding và tính các tín hiệu phục vụ lựa chọn:
Model Risk (U): mức độ mô hình chưa chắc chắn đối với dữ liệu. Novelty (N): mức độ khác biệt của frame so với dữ liệu lịch sử/Known Reference. Rarity (R): mức độ hiếm của frame trong phân bố dữ liệu hiện tại.
Các tín hiệu này được sử dụng để tạo candidate ranking, sau đó tiếp tục qua các bước temporal filtering, cosine de-duplication, diversity/k-center và quota nhằm hạn chế frame trùng lặp và tăng độ bao phủ của batch được chọn.
Kết quả cuối cùng là một Top-K frame có score, thứ hạng và lý do lựa chọn rõ ràng. Perception Engineer hoặc Reviewer có thể xem preview từng frame, Approve/Reject, khóa batch sau khi review và xuất các frame đã duyệt để tiếp tục quy trình gán nhãn hoặc huấn luyện.
Phần uncertainty cho object detection được xây dựng dựa trên hướng nghiên cứu Portable Active Learning (PAL), đặc biệt là ý tưởng LIUS — class-specific instance uncertainty và các tín hiệu diversity ở cấp ảnh. Fleet Miner mở rộng các ý tưởng này thành kiến trúc sản phẩm riêng với ba tín hiệu chuẩn hóa U/N/R, đồng thời giữ toàn bộ quá trình lựa chọn độc lập với quyết định cuối của con người.
MVP hiện được triển khai theo hướng local, human-in-the-loop và explainable, với workflow từ Create Run → Run Status → Top-K Result → Human Review → Lock Batch → Export. Mục tiêu của dự án là giảm lượng dữ liệu cần gán nhãn nhưng vẫn ưu tiên được các sample mang learning value cao, đồng thời đánh giá hiệu quả của phương pháp so với Random Sampling.
Trong giai đoạn tiếp theo, Fleet Miner có thể được mở rộng về quy mô dataset, hỗ trợ thêm các perception task/model, tối ưu tốc độ inference/scoring và tích hợp trực tiếp với các nền tảng labeling để hình thành một vòng lặp Active Learning hoàn chỉnh từ data mining → annotation → retraining → đánh giá mô hình.