Đang chạy mực qua máy in — từng lớp màu một, kiên nhẫn nhé!
№ 01
№ 02
№ 03
№ 04
№ 05
№ 06
VDaAgent - Data Profiling · AI·20K Demo Day Zine
№ 24
VDaAgent - Data Profiling
VDaAgent là nền tảng AI Agent profiling và phân tích dữ liệu theo hướng evidence-first, giúp chuyển hóa dữ liệu thô thành insight, biểu đồ và báo cáo có thể kiểm chứng tức thì. Hệ thống kết hợp tính toán chuẩn xác (deterministic) với AI linh hoạt nhằm tăng tốc phân tích tối đa mà vẫn đảm bảo an toàn và bảo mật dữ liệu.
Fig. 01 · Ảnh dự án
1. Bài toán đặt ra (Problem Statement)
Trong kỷ nguyên dữ liệu lớn, việc khai thác và phân tích dữ liệu gặp phải các rào cản chính:
Thời gian chuẩn bị và profiling kéo dài: Data Analyst / Scientist mất từ vài giờ đến nhiều ngày chỉ để làm sạch, thống kê phân phối, kiểm tra chất lượng dữ liệu và phát hiện bất thường.
Nguy cơ hallucination của LLM: Khi dùng AI tạo insight hoặc trả lời truy vấn, mô hình thường xuyên "bịa" số liệu hoặc đưa ra kết luận không có cơ sở kiểm chứng.
Rủi ro bảo mật & rò rỉ dữ liệu: Dữ liệu nhạy cảm (PII) dễ bị lộ khi gửi trực tiếp toàn bộ dữ liệu thô vào LLM; các hệ thống phân tích chưa có cơ chế cô lập dữ liệu (multi-workspace isolation) nghiêm ngặt.
2. Giải pháp kỹ thuật (Technical Solution & Architecture)
VDaAgent (P-170) là nền tảng AI Agent phân tích và profiling dữ liệu chuyên sâu theo nguyên tắc Evidence-First (Mọi kết luận phải có bằng chứng toán học/thống kê xác thực).
Kiến trúc cốt lõi:
Động cơ tính toán phân tán (High-performance Compute): Sử dụng DuckDB chạy trên worker riêng biệt để xử lý dữ liệu lớn (CSV, Parquet, JSON, MySQL, MongoDB) với tốc độ cao, chỉ nạp metadata cần thiết vào Pandas khi kiểm định thống kê.
Quy trình Human-in-the-Loop (HITL) với LangGraph: Cho phép chuyên gia can thiệp, duyệt (confirm/reject/edit) các semantic proposal và giả thuyết do AI đề xuất.
Hệ thống QA có Guardrail (Deterministic Validation):
Mọi khẳng định định lượng đều được đối soát qua công cụ trích xuất bằng chứng toán học.
AI chủ động từ chối trả lời (abstain) nếu thiếu bằng chứng dữ liệu, loại bỏ hoàn toàn hallucination.
Bảo mật & PII-Safe: Tự động phát hiện thông tin định danh cá nhân (PII, quasi-identifiers), che dấu dữ liệu nhạy cảm trước khi xử lý qua LLM.
3. Tính khả thi & Điểm nổi bật (Feasibility & Key Highlights)
Khả thi thực tế cao: Đã đóng gói container hoàn chỉnh và triển khai thực tế trên hạ tầng đám mây (Azure App Service / Supabase) với đầy đủ bộ kiểm thử Unit/Integration/E2E.
§
Phụ lục — Demo & Slides
Video demo
Bản demo trực tiếp
Slide trình bày
Tối ưu chi phí & tài nguyên: Cơ chế caching metadata và so sánh Data Drift trực tiếp từ thống kê đã lưu, không cần tải hay tính toán lại raw data.
Xuất báo cáo chất lượng cao: Tự động tổng hợp Profile, Biểu đồ và Insight thành bản chụp bất biến (Immutable Snapshot) và xuất PDF chuẩn mực ngay trên server.
Độc lập và an toàn: Cô lập không gian làm việc (Workspace Isolation) đa tầng từ cấp cơ sở dữ liệu.
4. Hướng phát triển (Future Roadmap)
Mở rộng kết nối nguồn dữ liệu: Hỗ trợ Data Warehouse chuyên dụng (Snowflake, BigQuery, ClickHouse) và Streaming Data (Kafka).
Tự động hóa phát hiện Data Drift & Anomalies: Cung cấp webhook/cảnh báo chủ động qua Slack/Teams khi dữ liệu đầu vào biến động bất thường.
Mở rộng Agentic Capabilities: Bổ sung agent tự động sinh kịch bản làm sạch dữ liệu (Auto-Data Cleaning Scripts) và đề xuất mô hình Machine Learning phù hợp.