№ 45
VinaVoice là nền tảng AI hỗ trợ xử lý cuộc họp và tin nhắn thoại: chuyển giọng nói thành văn bản, tóm tắt nội dung, hỏi đáp theo ngữ cảnh, tạo biên bản họp, cho phép người dùng tra cứu nội dung cuộc họp bằng chatbot và hiển thị trực tiếp transcript ngay khi người dùng nói trong cuộc họp.
VinaVoice là nền tảng họp, nhắn tin và quản lý tri thức bằng giọng nói, được tối ưu cho tiếng Việt. Dự án hướng đến việc giải quyết tình trạng người dùng phải mất nhiều thời gian nghe lại bản ghi, ghi chép thủ công, lập biên bản và tìm kiếm các quyết định quan trọng sau cuộc họp.
Thay vì chỉ chuyển âm thanh thành một đoạn văn bản dài, VinaVoice xây dựng một quy trình hoàn chỉnh từ âm thanh → transcript → tóm tắt → dữ kiện có cấu trúc → hỏi đáp có nguồn → biên bản Word.
Điểm khác biệt cốt lõi của dự án là khả năng kiểm chứng thông tin và tạo ra biên bản cuộc họp theo format người dùng đưa vào. Mỗi dữ kiện quan trọng do AI tạo ra đều có thể liên kết với câu nói gốc và mốc thời gian tương ứng. Người dùng có thể nhấn “Nghe lại” để phát đúng đoạn âm thanh đã tạo ra thông tin đó, thay vì phải tin hoàn toàn vào kết quả của AI.
Trong các cuộc họp tại doanh nghiệp, cơ quan, trường học và nhóm dự án, nhiều thông tin quan trọng thường bị phân tán trong hàng chục phút ghi âm hoặc hàng trăm tin nhắn. Sau cuộc họp, người tham gia thường gặp các vấn đề:
VinaVoice giải quyết các vấn đề này bằng cách biến âm thanh thành một nguồn dữ liệu có cấu trúc, có thể tìm kiếm, kiểm tra và đưa vào hành động.
Người dùng có thể tải lên các file MP3, WAV, M4A hoặc MP4. Hệ thống tự động đưa file vào hàng đợi xử lý, nhận dạng giọng nói và tạo transcript theo từng đoạn.
Mỗi đoạn transcript giữ lại:
Người dùng có thể nhập trước số lượng người nói và các từ khóa như tên người, tên doanh nghiệp, địa danh, mã dự án hoặc thuật ngữ chuyên ngành để tăng độ chính xác.
VinaVoice hỗ trợ tách các lượt nói trong cùng một file âm thanh. Hệ thống xác định thời điểm từng người phát biểu và gán nhãn cho các đoạn tương ứng.
Ngoài việc phân biệt “Người nói 1”, “Người nói 2”, hệ thống còn sử dụng vân giọng để hỗ trợ nhận diện cùng một người xuyên nhiều file. Khi người dùng đã xác nhận tên cho một giọng nói, VinaVoice có thể đề xuất lại người đó trong những cuộc họp sau.
Tính năng này giúp trả lời những câu hỏi quan trọng như:
Những từ hoặc đoạn có độ tin cậy thấp được đánh dấu để người dùng dễ dàng kiểm tra.
Người dùng có thể:
Cơ chế này thể hiện nguyên tắc Human-in-the-Loop: AI hỗ trợ xử lý, nhưng con người vẫn giữ quyền kiểm soát đối với các thông tin chưa chắc chắn.
Sau khi có transcript, hệ thống sử dụng quy trình AI đa tác nhân để phân tích nội dung. Các tác nhân đảm nhiệm những vai trò khác nhau như làm sạch transcript, phân tích chủ đề, trích xuất dữ kiện, kiểm tra độ tin cậy và liên kết kết quả với bằng chứng.
Kết quả gồm:
Thay vì chỉ tạo ra một đoạn tóm tắt tự do, VinaVoice lưu nội dung dưới dạng các sự kiện có cấu trúc. Đây là nền tảng để hệ thống xây dựng bộ nhớ tổ chức và phục vụ việc tra cứu về sau.
Mỗi dữ kiện quan trọng có thể đi kèm:
Khi người dùng nhấn nút “Nghe lại”, hệ thống phát đúng đoạn âm thanh liên quan. Cơ chế này giúp người dùng kiểm chứng kết quả nhanh chóng và giảm rủi ro AI suy diễn hoặc cung cấp thông tin không có căn cứ.
Nguyên tắc thiết kế của VinaVoice là: không có bằng chứng thì không được xem là sự thật đã xác nhận.
Người dùng có thể đặt câu hỏi bằng ngôn ngữ tự nhiên, chẳng hạn:
Hệ thống sử dụng cơ chế truy hồi kết hợp giữa tìm kiếm toàn văn và tìm kiếm ngữ nghĩa để lấy các dữ kiện phù hợp. Câu trả lời chỉ được tạo từ nội dung mà người dùng có quyền truy cập và được trả về cùng các nguồn tham chiếu.
Việc truy hồi trên sự kiện có cấu trúc giúp kết quả chính xác hơn so với tìm kiếm trên những đoạn transcript dài, rời rạc.
VinaVoice hỗ trợ tạo và tham gia phòng họp trực tuyến bằng mã phòng. Người tạo phòng có thể đặt tiêu đề và mật khẩu bảo vệ.
Trong cuộc họp, hệ thống hỗ trợ:
Các tác vụ nặng tiếp tục chạy ở chế độ nền ngay cả khi người dùng rời khỏi trang.
Đối với cuộc họp trực tiếp tại phòng họp, lớp học hoặc văn phòng, người dùng có thể sử dụng chế độ họp offline với một microphone chung.
Trong quá trình ghi âm, hệ thống hiển thị transcript trực tiếp, đồng thời xử lý bản ghi chất lượng cao ở phía sau. Nội dung được cắt theo khoảng lặng và lượt người nói. Sau khi kết thúc, transcript có thể được duyệt, tóm tắt, hỏi đáp và dùng để tạo biên bản.
VinaVoice tích hợp hệ thống nhắn tin nội bộ, hỗ trợ:
Mỗi hội thoại có một trợ lý AI riêng. Trợ lý chỉ sử dụng tin nhắn, transcript và dữ liệu thuộc hội thoại đang mở, giúp tránh trộn lẫn thông tin giữa các nhóm.
Sau khi cuộc họp được tóm tắt, người dùng có thể tạo biên bản từ mẫu Word.
Hệ thống cho phép:
{{ten_bien}}.Nếu một trường chưa đủ độ tin cậy, hệ thống yêu cầu người dùng kiểm tra. Nếu cuộc họp không có dữ liệu phù hợp, người dùng có thể xác nhận để trống; AI không tự tạo thông tin chỉ để hoàn thành biểu mẫu. Tài liệu còn trường chưa xác nhận chỉ được xuất dưới dạng bản nháp.
Khu vực quản trị cho phép quản trị viên:
VinaVoice được xây dựng theo kiến trúc tách biệt giữa giao diện, dịch vụ web, tác vụ nền, mô hình AI và tầng lưu trữ:
pgvector và tìm kiếm toàn văn để thực hiện truy hồi lai.Hệ thống tách luồng ghi và luồng đọc. Các tác vụ nặng được thực hiện trước ở worker; khi người dùng đặt câu hỏi, dịch vụ chỉ cần truy hồi các dữ kiện đã xử lý. Cách thiết kế này giúp giảm thời gian phản hồi và tránh việc chatbot phải phân tích lại toàn bộ transcript ở mỗi câu hỏi.
Dự án có tính khả thi vì các module chính đã được xây dựng thành một hệ thống thống nhất, gồm giao diện người dùng, backend, cơ sở dữ liệu, hàng đợi tác vụ, xử lý giọng nói, phòng họp, nhắn tin, hỏi đáp và tạo tài liệu.
Kiến trúc serverless cho các tác vụ GPU giúp nhóm không phải duy trì máy chủ GPU liên tục. Các tác vụ AI chạy nền nên không làm khóa request của người dùng. Hệ thống cũng có khả năng tiếp tục hoạt động ở chế độ tìm kiếm toàn văn khi dịch vụ embedding không khả dụng.
Việc sử dụng các dịch vụ có thể mở rộng độc lập như PostgreSQL, Redis, R2 và GPU serverless giúp dự án phù hợp với cả giai đoạn thử nghiệm lẫn triển khai thực tế.
Các nhóm người dùng tiềm năng gồm:
VinaVoice áp dụng nhiều lớp kiểm soát:
VinaVoice không chỉ là công cụ Voice-to-Text hoặc chatbot thông thường. Dự án kết hợp toàn bộ vòng đời của thông tin cuộc họp:
Thu âm → nhận dạng → phân biệt người nói → duyệt transcript → tóm tắt → trích xuất sự kiện → hỏi đáp có nguồn → nghe lại bằng chứng → tạo biên bản.
Ba điểm khác biệt nổi bật là:
Trong các giai đoạn tiếp theo, dự án có thể mở rộng theo các hướng:
Mục tiêu dài hạn của VinaVoice là trở thành bộ nhớ có thể kiểm chứng của tổ chức, nơi các cuộc họp và trao đổi bằng giọng nói không còn bị thất lạc mà được chuyển thành dữ liệu hữu ích, có nguồn, có trách nhiệm và có thể đưa trực tiếp vào công việc.