№ 54
Đề tài xây dựng AI Catalog Assistant tích hợp OpenMetadata, Git, SQL/PySpark và Execution Agent nhằm tự động phân tích lineage, đánh giá ảnh hưởng của thay đổi dữ liệu, hỗ trợ con người kiểm duyệt kết quả, đồng thời sinh và review cấu hình Job/Workflow trước khi triển khai pipeline.
Trong hệ thống dữ liệu, source code, metadata và pipeline thường nằm rải rác trên Git, OpenMetadata, Spark và Airflow. Điều này khiến việc truy vết nguồn gốc dữ liệu, phân tích tác động khi thay đổi bảng/cột và triển khai pipeline tốn nhiều thời gian, dễ sai sót.
Xây dựng AI Catalog Assistant có khả năng đọc SQL, PySpark và source code từ Git để phân tích table/column lineage, đối chiếu entity với OpenMetadata và trực quan hóa quan hệ upstream/downstream. Sau khi người dùng kiểm duyệt kết quả, Execution Agent sinh Job Config và Workflow Config, hỗ trợ chạy định kỳ hoặc thủ công, cho phép review JSON trước khi publish lên Git và triển khai qua Airflow/Spark.
Giải pháp sử dụng các thành phần đã được triển khai và kiểm thử như FastAPI, LangGraph, OpenAI, OpenMetadata, Airflow, Spark, OpenLineage, Git và Kubernetes. Quy trình Human-in-the-loop giúp hạn chế sai lệch của AI, trong khi kiến trúc config-driven cho phép tích hợp vào nền tảng dữ liệu hiện có mà không cần thay đổi toàn bộ hệ thống.
Trong tương lai, hệ thống có thể hỗ trợ thêm nhiều ngôn ngữ và công cụ ETL, phân tích repository quy mô lớn, phát hiện breaking change tự động, cảnh báo tác động theo thời gian thực, gợi ý cách sửa pipeline, quản lý phiên bản lineage và tự động hóa triển khai đa môi trường với cơ chế phê duyệt theo vai trò.
Airflow: https://airflow.datalabutehy.com
Repo git chứa workflow config: https://github.com/ghostWood1071/native-data-platform.git
(tk: letritung2005, mk:@Tung123456)