№ 87
Trợ lý cabin tiếng Việt offline: điều khiển xe bằng giọng nói, trả lời mọi câu hỏi về sổ tay – không cần internet, không lo riêng tư.
Bài toán Xe hơi hiện đại đã có màn hình IVI và trợ lý giọng nói, nhưng phần lớn phụ thuộc vào Cloud. Hệ quả: mất sóng trong hầm/vùng sâu là "câm", độ trễ cao (3–5 giây) gây khó chịu khi lái, quyền riêng tư bị xâm phạm khi giọng nói và lịch sử di chuyển bị gửi lên Cloud nước ngoài, và người dùng vẫn phải thao tác tay để chỉnh điều hòa, nhạc, dẫn đường. Trong bối cảnh Luật Bảo vệ dữ liệu cá nhân 2026 yêu cầu xử lý dữ liệu tại chỗ, đây là vấn đề cấp bách cần giải quyết.
Giải pháp kỹ thuật VIVI là trợ lý cabin tiếng Việt chạy hoàn toàn offline, không phụ thuộc Cloud, bảo vệ quyền riêng tư tuyệt đối. Hệ thống sử dụng ASR Faster‑Whisper (PhoWhisper-base int8) để nhận dạng giọng nói tiếng Việt, LLM Qwen2.5‑3B Q4_K_M để suy luận và tool calling, LangGraph Agent 8 nodes để điều phối luồng xử lý, FAISS + e5‑small embedding cho RAG grounded (mọi câu trả lời đều có trích dẫn nguồn), Piper TTS để phát giọng nói, và MQTT + Digital Twin để mô phỏng điều khiển xe. Hệ thống có cơ chế an toàn S1/S2/S3 và HITL (Human‑In‑The‑Loop) cho lệnh nhạy cảm, cùng tính năng cá nhân hóa qua Driver Profile và Routines (Đi làm, Về nhà, Nghỉ ngơi).
Tính khả thi Hiện tại, VIVI đã hoàn thành các module cốt lõi: LangGraph Agent với 9 tools điều khiển xe, Safety Policy phân loại S0–S3, RAG grounded với FAISS và citation, MQTT + Digital Twin, WebSocket realtime, và ASR + TTS. Hệ thống đạt 271 unit tests pass, 47 MQTT tests, 6 RAG integration tests. Số liệu đo được: p50 latency 2.4s (≤2.5s), p95 latency 2.9s (≤3.0s), RAM 3.2 GB (≤3.5 GB), Safety Pass Rate 100%, Intent Macro‑F1 0.92 (≥0.90), Tool Exact Match 92% (≥90%), Citation Validity 100%. Tổng dung lượng model < 3.0 GB (ASR 150MB + LLM 2.1GB + TTS 100MB + Embedding 80MB). Các hạng mục còn lại như Multi‑agent spike (Tuần 8) và Eval Dashboard (Tuần 7) đã được lên kế hoạch trong lộ trình 10 tuần.
Hướng phát triển Lộ trình 10 tuần bao gồm: Tuần 1–2 hoàn thiện Baseline, UAT, Spec; Tuần 3–4 Benchmark Q4/Q8 và Post‑processing SLM; Tuần 5–6 xây dựng Routines, Context Engine, Driver Profile và HITL; Tuần 7 Eval Dashboard; Tuần 8 Multi‑agent spike (chỉ tích hợp nếu có lợi ích đo được); Tuần 9 Hardening, User test với 5–8 người nói tiếng Việt, Barge‑in; Tuần 10 Pitch deck, Demo live và Video dự phòng. Trong tương lai (Phase 2–3), VIVI sẽ mở rộng với OTA Dashboard giám sát nhiều xe và cập nhật mô hình qua mạng, hỗ trợ đa ngôn ngữ (tiếng Anh, Trung), tích hợp Multimodal với camera trong cabin, và chạy trên phần cứng sản xuất (NXP/Renesas SoC). Đội ngũ gồm 4 người phụ trách Agent/Backend, Offline Model/Eval, UI/Dashboard, và Integration/CI/QA/UAT, với PM/PO điều phối scope và acceptance criteria.
VIVI – Voice-first. An toàn. Cá nhân hóa.