Bỏ qua tới nội dung
Gemini 3.8 Live: Voice Agent vừa nói vừa gọi công cụ nền
tin-tuc

Gemini 3.8 Live: Voice Agent vừa nói vừa gọi công cụ nền

Dũng16 tháng 9, 20266 phút đọc
Tin tức

Gemini 3.8 Live tiếp tục hội thoại trong khi công cụ và API xử lý tác vụ nền, mở ra kiến trúc Voice Agent tự nhiên và hữu ích hơn cho doanh nghiệp.

Google ngày 15/09/2026 giới thiệu hai mô hình hội thoại thời gian thực mới: Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking. Điểm đáng chú ý với doanh nghiệp không chỉ nằm ở việc giọng nói tự nhiên hơn. Theo công bố của Google, mô hình có thể tiếp tục trò chuyện trong khi công cụ và API đang xử lý tác vụ ở nền. Đây là thay đổi kiến trúc quan trọng nếu doanh nghiệp muốn xây Voice Agent biết làm việc, thay vì chỉ trả lời câu hỏi.

Gemini 3.8 Live được thiết kế cho quy mô lớn và hiệu quả chi phí, kết hợp hội thoại, ngữ cảnh hình ảnh và phản hồi gần thời gian thực. Bản Extended Thinking hướng đến quy trình phức tạp hơn, cần suy luận nhiều bước. Google đưa cả hai vào Gemini API và Google AI Studio; một số khả năng dành cho doanh nghiệp vẫn ở giai đoạn private preview.

Từ chatbot thoại sang tác nhân biết hành động

Trong một hệ thống giọng nói truyền thống, người dùng thường phải chờ từng bước: nói yêu cầu, hệ thống xử lý, gọi dịch vụ bên ngoài rồi mới trả lời. Khi một API chậm, trải nghiệm dễ rơi vào khoảng lặng khó chịu. Google mô tả Gemini 3.8 Live theo hướng khác: mô hình có thể ghi nhận yêu cầu, tiếp tục đối thoại và đồng thời thực thi công cụ hoặc API ở nền.

Ví dụ, một Voice Agent đặt lịch có thể hỏi thêm khung giờ ưu tiên trong khi dịch vụ lịch đang kiểm tra lịch trống. Một trợ lý onboarding có thể xem màn hình, hướng dẫn bước tiếp theo và song song truy xuất chính sách nội bộ. Với Extended Thinking, mô hình còn có thể phát tín hiệu sớm như “để tôi kiểm tra” và thuật lại tiến độ của tác vụ nhiều bước.

Nhận định của Học viện AI: Giá trị kinh doanh của khả năng này nằm ở việc tách luồng hội thoại khỏi luồng thực thi. Nếu triển khai đúng, Agent không cần “đóng băng” cuộc trò chuyện mỗi lần gọi công cụ. Tuy nhiên, kiến trúc song song cũng làm tăng yêu cầu về quản trị trạng thái: hệ thống phải biết tác vụ nào đang chạy, kết quả nào đã hết hạn và hành động nào cần con người phê duyệt.

Sơ đồ Gemini 3.8 Live tiếp tục hội thoại trong khi gọi công cụ và API ở nền
Sơ đồ do Học viện AI tổng hợp từ công bố của Google ngày 15/09/2026. Điểm benchmark do Google và Artificial Analysis công bố; cần kiểm thử lại theo use case thực tế.

97 ngôn ngữ, ngữ cảnh hình ảnh và các con số benchmark

Google cho biết Gemini 3.8 Live có thể tự động nhận biết và chuyển đổi giữa 97 ngôn ngữ được hỗ trợ ngay trong một cuộc trò chuyện. Mô hình cũng xử lý đầu vào hình ảnh gần thời gian thực, cho phép kết hợp lời nói với những gì camera hoặc màn hình đang hiển thị. Đây là nền tảng cho các tình huống như hỗ trợ kỹ thuật tại hiện trường, hướng dẫn thao tác hay tư vấn có ngữ cảnh trực quan.

Về benchmark, Google công bố Gemini 3.8 Live Extended Thinking đạt 82,6 điểm trên Artificial Analysis Speech-to-Speech Index, 68,6% trên τ-Voice và 97,7% trên Big Bench Audio. Trang xếp hạng của Artificial Analysis tại thời điểm kiểm tra cũng hiển thị 82,6 điểm tổng hợp và 68,6% cho năng lực hoàn thành tác vụ có công cụ. Chỉ số tổng hợp này cân bằng bốn thành phần: suy luận bằng giọng nói, hiệu suất tác nhân, đánh giá ưu tiên của người dùng và tỷ lệ hoàn thành tác vụ.

Cần đọc các con số đúng phạm vi. τ-Voice mô phỏng các tình huống dịch vụ khách hàng như đổi chuyến bay, khiếu nại giao dịch bán lẻ hoặc xử lý vấn đề viễn thông; đây không phải bằng chứng rằng mô hình sẽ đạt cùng tỷ lệ trong quy trình riêng của từng doanh nghiệp. 97 ngôn ngữ được hỗ trợ cũng không đồng nghĩa chất lượng nhận dạng, phát âm và hiểu ngữ cảnh ngang nhau ở mọi ngôn ngữ.

Doanh nghiệp Việt Nam nên thử nghiệm gì trước?

Thay vì bắt đầu bằng một trợ lý đa năng, doanh nghiệp nên chọn một quy trình thoại hẹp, có dữ liệu rõ và sai sót dễ đảo ngược. Ba ứng viên phù hợp là đặt lịch, tra cứu trạng thái đơn hàng và hướng dẫn nhân viên mới. Mỗi quy trình nên được chia thành ba lớp:

  • Hội thoại: nhận yêu cầu, xác nhận lại và xử lý ngắt lời.
  • Công cụ: gọi API, đọc dữ liệu hoặc tạo tác vụ ở nền.
  • Kiểm soát: giới hạn quyền, xin xác nhận trước hành động nhạy cảm và lưu vết quyết định.

Đội triển khai cũng nên đo đồng thời chất lượng hội thoại và kết quả nghiệp vụ. Một Voice Agent nghe tự nhiên nhưng đặt sai lịch vẫn là hệ thống thất bại. Bộ chỉ số tối thiểu cần có gồm tỷ lệ hoàn thành tác vụ đúng, số lần người dùng phải nhắc lại, thời gian tới kết quả cuối, tỷ lệ chuyển sang nhân viên và số hành động bị chặn bởi chính sách.

Bài toán niềm tin không thể giao hoàn toàn cho mô hình. Google cho biết toàn bộ âm thanh do các sản phẩm AI của hãng tạo ra được gắn watermark SynthID để hỗ trợ nhận diện nội dung AI. Đây là một lớp minh bạch hữu ích, nhưng doanh nghiệp vẫn cần thông báo rõ người dùng đang nói chuyện với AI, quy định thời điểm chuyển cho người thật và bảo vệ dữ liệu thoại theo chính sách nội bộ.

Khả dụng hiện tại chưa đồng nghĩa sẵn sàng toàn bộ

Gemini 3.8 Live và bản Extended Thinking đã được mở cho nhà phát triển qua Gemini API và Google AI Studio từ ngày công bố. Tuy vậy, các kênh doanh nghiệp như Gemini Enterprise vẫn ở private preview; một số trải nghiệm trong Workspace, Gemini Live và Search có phạm vi triển khai khác nhau. Khi lập kế hoạch, đội sản phẩm cần kiểm tra đúng bề mặt sử dụng, khu vực, điều khoản dữ liệu và quyền truy cập của tài khoản thay vì suy ra từ một thông báo chung.

Nhận định của Học viện AI: Gemini 3.8 Live cho thấy Voice Agent đang chuyển từ “giao diện nói chuyện” thành lớp điều phối công việc thời gian thực. Lợi thế cạnh tranh sẽ không chỉ nằm ở mô hình có điểm benchmark cao hơn, mà ở thiết kế quy trình cho phép Agent vừa giữ mạch hội thoại, vừa dùng công cụ đúng quyền và trả kết quả có thể kiểm chứng.

Để xem thêm các góc triển khai liên quan, bạn có thể đọc 5 tiêu chí tạo niềm tin cho AI Agent CSKH, Gemini ghi nhớ chỉ dẫn trong Google WorkspaceMeta mở MCP cho WhatsApp Business.

CTA: Nếu doanh nghiệp của anh/chị muốn xác định một quy trình Voice Agent có thể thử nghiệm an toàn trong 30 ngày, hãy nhận proposal triển khai AI theo nhu cầu từ Học viện AI.

Nguồn tham khảo

#Gemini 3.8 Live
#Voice Agent
#AI Agent
#Google
#doanh nghiệp

Đặt lịch tư vấn 1-1 với chuyên gia

Phân tích nhu cầu AI cho doanh nghiệp bạn trong 30 phút — miễn phí.

ZChat ZaloMessenger0966.399.303