1. Bài toán
Trong quy trình phát triển mô hình Object Detection, chất lượng của dữ liệu (ground-truth) đóng vai trò sống còn. Tuy nhiên, việc gán nhãn thủ công luôn tồn tại sai sót (bỏ sót vật thể, gán sai class, vẽ box lệch, nhãn thừa do ảo ảnh). Rà soát lại hàng vạn bức ảnh bằng mắt thường là quá trình tốn kém, mệt mỏi và dễ lọt lưới, trở thành nút thắt cổ chai lớn nhất ngăn cản việc đưa AI vào thực tế.
2. Giải pháp kỹ thuật
Label Guardian giải quyết bài toán "Data Auditing" bằng một kiến trúc đa tầng (Multi-Layer) kết hợp Agentic AI với nguyên tắc bất biến dữ liệu gốc (Immutable Source Dataset):
- Guideline Agent: Sử dụng AI để đọc hiểu tài liệu hướng dẫn gán nhãn của con người (PDF/Markdown), sau đó trích xuất thành một bộ luật số hoá (
AuditPolicy) bắt buộc tuân thủ.
- Layer 0 (Geometry Scan): Quét tốc độ cao toàn bộ dữ liệu bằng các thuật toán hình học để tìm lỗi hiển nhiên (box nằm ngoài ảnh, diện tích bằng 0, trùng khít).
- Layer 1 (OOF Prediction & LLM Verifier): Hệ thống tự động đẩy dữ liệu lên Kaggle để huấn luyện chéo (Out-of-fold) bằng các model YOLO, tìm ra các vùng sai lệch giữa nhãn gốc và dự đoán. Sau đó, Layer 1 Verifier Agent (LLM) đóng vai trò như một người kiểm duyệt độc lập: đọc các lỗi dự đoán, đối chiếu với bộ luật
AuditPolicy, và đưa ra phán quyết khách quan (thiếu nhãn, sai class, box thừa...).
- Human-in-the-loop Review UI: Cung cấp giao diện tập trung để con người duyệt lại các nghi vấn do AI tìm ra. Mọi thay đổi đều được lưu lại dưới dạng Correction Patch (có tính truy vết) thay vì ghi đè lên dữ liệu nguồn.
3. Tính khả thi
- Tối ưu chi phí: Thay vì dùng Vision LLM đắt đỏ để quét toàn bộ dataset, hệ thống dùng model YOLO OOF miễn phí (train tự động trên Kaggle) làm bộ lọc thô, và chỉ gọi LLM Agent ở những điểm bất đồng, giúp giảm đến 90% chi phí API.
- Hiệu năng & Ổn định: Backend FastAPI bất đồng bộ kết hợp Supabase PostgreSQL xử lý trơn tru quy trình tải dữ liệu lớn, quản lý job state đáng tin cậy.
4. Hướng phát triển
- Bổ sung Layer 2 Semantic Verification: Tích hợp các Vision-Language Model (VLM) lớn để đánh giá trực tiếp hình ảnh ở những ca cực khó (Occlusion/Truncation nặng).
- Hỗ trợ mở rộng sang các dạng dữ liệu khác của Computer Vision như Image Segmentation (phân vùng ảnh) hoặc Keypoint Detection.
- Cung cấp Plugin tích hợp trực tiếp quy trình kiểm định vào các nền tảng gán nhãn phổ biến (như CVAT hay Label Studio).