№ 16
AI trực sự cố hạ tầng: tự phát hiện từ Prometheus, đọc log để chẩn đoán nguyên nhân, và đề xuất cách sửa kèm bằng chứng số liệu truy vết ngược được. Nhưng nó không có đường nào tự bấm nút — mọi hành động lên hệ thống thật đều phải có người phê duyệt.
Khi một dịch vụ sập hoặc chậm đột ngột, phần lớn thời gian đầu của người trực không dùng để sửa — mà dùng để thu thập bối cảnh: dò log từng service, đoán nguyên nhân, đối chiếu xem có ai vừa deploy gì không.
Công cụ theo dõi trả lời được "có gì đó sai". Nó không trả lời được sai cái gì và nên làm gì trước. Khoảng trống đó hiện do con người lấp bằng kinh nghiệm — thường là lúc 2 giờ sáng.
Tệ hơn: có loại sự cố mà số đo nói ngược sự thật. Ví dụ deploy thiếu migration — 100% request lỗi, nhưng p95 chỉ 0,048 giây, nhanh hơn lúc bình thường, vì request chết ngay ở câu lệnh đầu. Nhìn số đo là không thể đoán ra.
Agent chạy vòng quét trên LangGraph, 8 node, quét Prometheus mỗi 10 giây:
Vòng đời sự cố dùng Jira Cloud làm lớp lưu trữ: war room là issue, phê duyệt là workflow transition, dấu vết kiểm toán là changelog — thứ Agent không sửa được. Không tự xây CRUD, phân quyền, audit log.
Đã chạy end-to-end trên hạ tầng thật, không mô phỏng:
Bốn tình huống Agent bỏ lọt được kể tên trong tài liệu đo, gồm cả loại mà số đo không thể thấy: ghi sai dữ liệu trong khi vẫn trả 200 OK, dependency gửi dữ liệu ra ngoài, thu tiền hai lần do race condition. Đó là giới hạn đã đo được, không phải chỗ chưa thử.