Đang chạy mực qua máy in — từng lớp màu một, kiên nhẫn nhé!
№ 01
№ 02
№ 03
№ 04
№ 05
№ 06
AI Semantic Layer · AI·20K Demo Day Zine
№ 64
AI Semantic Layer
Tự động chuyển đổi DB schema kỹ thuật thành ngôn ngữ nghiệp vụ thống nhất. Xây dựng, quản trị và biên dịch chỉ số cho doanh nghiệp
Fig. 01 · Ảnh dự án
1. BÀI TOÁN & 3 NỖI ĐAU THỰC TẾ (Problem Statement)
Trong các doanh nghiệp hiện nay, việc khai thác dữ liệu từ cơ sở dữ liệu quan hệ (PostgreSQL, MySQL, SQLite) đang gặp phải 3 nút thắt nghiêm trọng gây tắc nghẽn dòng chảy dữ liệu:
Nỗi đau #1 (Góc độ Người dùng) — Tắc nghẽn tự phục vụ (Self-serve Bottleneck)
Thực trạng:“Tôi không biết SQL nhưng cần số liệu ngay để ra quyết định.”
Nguyên nhân: Quy trình truyền thống đòi hỏi kỹ sư dữ liệu phải dựng Semantic Layer thủ công bằng code (dbt, LookML) mất nhiều tuần. Người làm kinh doanh, BA không thể tự lấy số, bị phụ thuộc 100% vào đội ngũ IT/Data Team và phải xếp hàng chờ đợi.
Giải pháp P-069: AI tự động phân tích schema và dựng ngay Semantic Layer chuẩn tiếng Việt ngay khi kết nối Database.
Nỗi đau #2 (Góc độ Tổ chức) — Thiếu một nguồn chuẩn duy nhất (Metric Chaos)
Thực trạng:“Mỗi phòng ban tính số liệu một kiểu khác nhau.”
Nguyên nhân: Cùng một chỉ số kinh doanh như "Doanh thu thuần" hay "Active Users", Marketing tính một đằng, Kế toán tính một nẻo, Sales tính theo cách riêng. Các cuộc họp giao ban mất thời gian tranh cãi xem số của phòng ban nào đúng thay vì tập trung ra quyết định chiến lược.
Giải pháp P-069: Thiết lập cơ chế định nghĩa công thức chỉ số tập trung 1 lần, lưu vết lịch sử phiên bản (metric_versions) và dùng chung cho toàn bộ tổ chức (Single Source of Truth).
Nỗi đau #3 (Góc độ Thị trường) — Rào cản chi phí & nhân sự cho SME
Thực trạng:“Doanh nghiệp vừa và nhỏ (SME) không đủ ngân sách nuôi Data Team cồng kềnh.”
Nguyên nhân: Các nền tảng BI cao cấp trên thị trường (Looker, Cube.dev) đòi hỏi chi phí bản quyền đắt đỏ và kỹ sư chuyên trách vận hành. Doanh nghiệp SME muốn xây dựng hệ thống báo cáo bài bản nhưng bị rào cản tài chính và nhân sự chặn lại.
Giải pháp P-069: Nền tảng trọn gói gọn nhẹ: Kết nối Database là có ngay giải pháp Semantic Layer và BI hoàn chỉnh mà không cần đội ngũ Data Engineer chuyên trách.
2. GIẢI PHÁP KỸ THUẬT (Technical Solution & Architecture)
Hệ thống được thiết kế theo mô hình Một Nền tảng AI Agent — Hai Luồng Xử lý Khép kín kết hợp cùng Lớp Hội thoại Thông minh và Kiến trúc 4 Tầng.
2.1. Hai Luồng Xử lý Cốt lõi (Core Pipelines)
Luồng 1: Xây dựng & Quản trị — Tự động tạo Semantic Layer
§
Phụ lục — Demo & Slides
Video demo
Bản demo trực tiếp
Slide trình bày
Chuyển đổi cấu trúc kỹ thuật thô thành lớp ngữ nghĩa kinh doanh qua 5 bước tuần tự:
Bước 01 — Nạp cấu trúc DB (Ingestion): Quét schema Live Database qua SQLAlchemy Inspector hoặc phân tích cú pháp AST file SQL Dump DDL (PostgreSQL, MySQL, SQLite) bằng SqlDumpScanner & Parser. (Chỉ đọc metadata cấu trúc, không đọc dữ liệu khách hàng).
Bước 02 — Dựng Canonical Model (2-Pass AI Enrichment):
Pass 1: LLM trích xuất bảng chú giải thuật ngữ toàn cục (Domain Glossary).
Domain Clustering: Tự động gom cụm các bảng liên quan theo đồ thị khóa ngoại (FK) để tối ưu ngữ cảnh.
Pass 2: LLM gán ngữ cảnh tiếng Việt (business_name, description) và tự động chuẩn hóa quan hệ liên bảng (canonical_relationships), nhận diện Time Dimensions. Kèm cơ chế Fallback tự động khi gặp sự cố.
Bước 03 — AI đề xuất Metrics: Tự động sinh sẵn các công thức chỉ số cốt lõi ban đầu (Doanh thu, Đơn hàng, Tăng trưởng...).
Bước 04 — Kiểm duyệt & Lưu vết (HITL Review & Versioning): Chuyên viên dữ liệu (data_lead) xem xét, chỉnh sửa inline, phê duyệt chỉ số từ unverified thành approved và tự động lưu vết lịch sử phiên bản (metric_versions).
Bước 05 — Xuất file tích hợp (Export): Đóng gói Semantic Layer sẵn sàng xuất khẩu ra chuẩn JSON và YAML phục vụ tích hợp công cụ BI (dbt, Metabase, Power BI).
Luồng 2: Khai thác & Truy vấn — Truy vấn Tự nhiên Chuẩn xác 100% (Chỉ Live DB)
Khác với Text-to-SQL tự do tiềm ẩn nguy cơ ảo giác, Luồng 2 biên dịch xác định (Deterministic Compilation) qua 5 bước:
Bước 01 — Đặt câu hỏi tự nhiên: Người dùng hỏi bằng tiếng Việt qua Chat Studio hoặc chọn trên Metric Explorer.
Bước 02 — Ánh xạ Chỉ số & Chiều: Hệ thống ánh xạ câu hỏi với các Metrics (đã duyệt) và Dimensions có trong Semantic Layer.
Bước 03 — Tự động giải nối bảng:SemanticQueryCompiler tìm đường JOIN tối ưu dựa trên đồ thị canonical_relationships.
Bước 04 — Biên dịch câu lệnh SQL: Biên dịch thành câu SQL chuẩn xác theo dialect của Target DB (Postgres/MySQL/SQLite).
Bước 05 — Thực thi Live DB an toàn: Chạy Read-Only trên Live Database, hiển thị bảng kết quả và biểu đồ trực quan tức thì.
2.2. Khung Bảo vệ An toàn Đa tầng (AST Guardrails với sqlglot)
Chỉ cho phép SELECT duy nhất: Kiểm tra cây cú pháp AST, triệt tiêu 100% nguy cơ SQL Injection.
Tự động gắn trần an toàn: Auto-inject LIMIT 100 (tối đa 1000 dòng) và ép thời gian thực thi statement_timeout = 15s.
Bảo vệ thông tin nhạy cảm: Toàn bộ Connection URL được mã hóa đối xứng Fernet và chỉ giải mã tạm thời trong RAM khi thực thi tác vụ.
Quy tắc an toàn với SQL Dump: SQL Dump chỉ chứa DDL cấu trúc nên Luồng 2 từ chối thực thi và trả về mã lỗi HTTP 400 rõ ràng.
2.3. Lớp Hội thoại Thông minh (Conversational Layer)
Bộ điều phối AI (chat_graph): Tự động phân loại ý định người dùng giữa trò chuyện tổng quan (chitchat) và yêu cầu định nghĩa chỉ số nghiệp vụ mới (on_demand_metric_suggest).
Trình hướng dẫn từng bước (query_clarifier Wizard): Tương tác hỏi đáp đa vòng để làm rõ các câu hỏi truy vấn còn mơ hồ (khoảng thời gian, điều kiện lọc, tiêu chí nhóm) trước khi chuyển sang truy vấn dữ liệu.
2.4. Kiến trúc 4 Tầng của Hệ thống
Tầng 1 — Giao diện người dùng (Next.js 14 App Router, Tailwind CSS):
Cung cấp 5 không gian làm việc chuyên biệt: Mô hình dữ liệu (Data Model), Danh mục chỉ số (Metrics Catalog), Trình truy vấn dữ liệu (Metric Explorer), Phòng Studio AI (AI Chat & Wizard), Bảng điều khiển chia sẻ (Metrics Dashboard), và Xuất file BI (Export).
Tầng 2 — Cổng dịch vụ API (FastAPI, Async IO, Uvicorn):
25+ Endpoints bất đồng bộ hiệu năng cao, xác thực JWT, phân quyền Workspace RBAC 3 cấp độ (admin, data_lead, member), kiểm soát phiên làm việc và bảo vệ admin cuối cùng (Last-admin Invariant).
Tầng 3 — Bộ não điều phối AI (LangGraph, LangChain, OpenAI GPT-4o-mini):
Điều phối StateGraph, thiết lập cố định temperature = 0.0, tích hợp cơ chế Human-in-the-Loop (HITL) ngắt quãng để chờ chuyên viên phê duyệt.
Metadata Store: Lưu trữ từ điển dữ liệu, định nghĩa metric, lịch sử phiên bản và cấu hình Dashboard (với Optimistic Concurrency Control tránh xung đột ghi).
Target DB (Live): Cơ sở dữ liệu nguồn của khách hàng, chỉ tiếp nhận các truy vấn SELECT an toàn.
3. TÍNH KHẢ THI VÀ ĐÁNH GIÁ THỰC NGHIỆM (Feasibility & Evidence)
Dự án đã được triển khai hoàn thiện và chứng minh tính khả thi vượt trội qua các tiêu chí thực tế:
3.1. Các Con số Đo lường Năng lực Sản phẩm
12 / 12 Tính năng cốt lõi theo đặc tả PRD đã hoàn thành 100% (F-01 đến F-12).
4 / 4 Giai đoạn phát triển chuẩn mực đã hoàn tất: Backend Architecture · AI Engine · Frontend Web App · Testing & QA.
25+ Cổng API RESTful hoàn thiện, có tài liệu OpenAPI tự động và tích hợp kiểm thử.
35+ Bài kiểm thử tự động (Unit test, Integration test, Security Guardrails) đạt chuẩn chất lượng.
3.2. Bằng chứng Thực nghiệm & Điểm mạnh Thực tế
Đo lường chất lượng độc lập: Đánh giá độ tương đồng tên nghiệp vụ và mô tả tiếng Việt bằng thuật toán chuẩn hóa, không phụ thuộc vào cảm tính của AI.
Bảo mật đa lớp nghiêm ngặt: Phân tách rõ ràng giữa quyền quản trị hệ thống (admin) và quyền quản trị dữ liệu (data_lead); mã hóa Fernet toàn bộ chuỗi kết nối; ngăn chặn hoàn toàn việc rò rỉ dữ liệu thô trong bước sinh Semantic Layer.
Loại bỏ 100% rủi ro ảo giác (Zero Hallucination Runtime): Việc phân tách rạch ròi giữa AI làm giàu ngữ nghĩa (Luồng 1) và Compiler biên dịch xác định (Luồng 2) giúp câu SQL luôn chuẩn xác tuyệt đối, không có sai số trong báo cáo tài chính/kinh doanh.
Tối ưu chi phí vận hành: Cơ chế phân cụm đồ thị giảm > 60% chi phí token khi nạp schema; toàn bộ quá trình truy vấn hàng ngày (Luồng 2) chạy bằng code thuần túy, tiêu tốn 0 token LLM.
4. ĐỊNH HƯỚNG PHÁT TRIỂN (Roadmap)
Lộ trình phát triển sản phẩm được hoạch định thực tế theo 3 chặng:
Chặng 1 (Đang triển khai): Hoàn thiện Mô hình Ngữ nghĩa Nâng cao
Chuẩn hóa quy trình 4 giai đoạn: Khám phá schema → Kiểm duyệt HITL → Định nghĩa chỉ số → Truy vấn trực tiếp.
Tách biệt hoàn toàn giữa cấu trúc bảng vật lý và công thức tính chỉ số kinh doanh độc lập.
Tích hợp AI tự động phát hiện trùng lặp: Cảnh báo ngay cho Data Lead nếu công thức mới bị trùng hoặc mâu thuẫn với chỉ số đã có trong hệ thống.
Chặng 2 (Giai đoạn tiếp theo): Mở rộng Khả năng Đánh giá & Đa Ngành
Mở rộng bộ dữ liệu chuẩn (Benchmark Datasets) sang nhiều ngành nghề mới ngoài Thương mại Điện tử: Tài chính - Ngân hàng, Y tế, Chuỗi Cung ứng, Bán lẻ.
Cơ chế đánh giá kết hợp (Hybrid Evaluation): Kết hợp chấm điểm logic tự động với quy trình kiểm định của chuyên gia dữ liệu.
Thiết lập bộ tiêu chuẩn chất lượng: Đảm bảo độ chính xác của Semantic Layer đạt trên 90% trước khi đưa vào khai thác thực tế.
Chặng 3 (Tầm nhìn tương lai): Hệ sinh thái Tích hợp Mở rộng
Đồng bộ tự động lên công cụ BI: Đẩy từ điển dữ liệu và định nghĩa chỉ số lên Metabase, dbt Cloud thông qua Webhook tự động.
Truy vấn liên cơ sở dữ liệu (Cross-DB / Federated Query): Hỗ trợ ghép nối và truy vấn an toàn giữa nhiều nguồn database khác nhau trong cùng một câu hỏi kinh doanh.
Tự động lập hồ sơ dữ liệu (Data Profiling): Tự động thống kê số lượng dòng, độ phủ dữ liệu, phân bố giá trị định kỳ để làm giàu thêm ngữ cảnh cho AI.
3 GIÁ TRỊ CỐT LÕI MANG LẠI (Value Proposition)
Dữ liệu tự phục vụ — Không cần SQL: Người làm kinh doanh lấy số liệu tức thì qua giao diện trực quan và trợ lý AI — chấm dứt cảnh xếp hàng chờ đợi IT.
Một nguồn chuẩn duy nhất (Single Source of Truth): Chỉ số cốt lõi định nghĩa tập trung 1 lần, cả công ty dùng chung — loại bỏ hoàn toàn tình trạng mâu thuẫn số liệu giữa các phòng ban.
Xóa bỏ rào cản chi phí cho SME: Kết nối database là có ngay hệ thống Semantic Layer & BI hoàn chỉnh — doanh nghiệp vừa và nhỏ sở hữu năng lực phân tích dữ liệu bài bản mà không cần nuôi Data Team tốn kém.