Một sản phẩm của BEACON MEDIA
Chuyên mục
Media
Báo cáo đặc biệt
Một sản phẩm của BEACON MEDIA
Khám phá nhiều hơn với tài khoản
Đăng nhập để lưu trữ và dễ dàng truy cập những bài viết bạn yêu thích trên Bloomberg Businessweek Việt Nam.
BBWV - Nhóm Big Tech gồm OpenAI, Google cũng như nhiều startup khác đang đẩy mạnh công nghệ giọng nói khi AI chuyển sang thực hiện những công việc kéo dài cho người dùng.
Hình ảnh: Shutterstock
Tác giả: Thường Quân
11 tháng 08, 2026 lúc 6:30 AM
Tóm tắt bài viết bởi
Một câu nói có thể sớm thay thế hàng loạt lần gõ phím để giao việc cho AI. OpenAI, Google và nhiều startup đang tăng tốc phát triển công nghệ giọng nói, đặt cược vào một cách tương tác mới khi các AI Agent ngày càng có khả năng tự thực hiện những nhiệm vụ phức tạp.
Các chatbot thế hệ đầu chủ yếu nhận câu lệnh bằng văn bản rồi trả về câu trả lời. AI Agent hiện hướng đến một quy trình dài hơn: nhận yêu cầu, hiểu mục tiêu, thực hiện nhiều bước và trao đổi lại với người dùng trong quá trình xử lý.
Giọng nói phù hợp với kiểu tương tác này. Người dùng có thể mô tả một vấn đề trong vài phút, bổ sung thông tin khi AI đặt câu hỏi và sửa yêu cầu ngay trong cuộc hội thoại.
OpenAI và Google gần đây liên tục nâng cấp các sản phẩm giọng nói. Các mô hình mới có khả năng xử lý và tạo âm thanh trực tiếp, giúp cuộc hội thoại diễn ra nhanh hơn và tự nhiên hơn so với hệ thống cũ.
Trợ lý giọng nói trước đây thường hoạt động theo chuỗi ba bước: thu âm giọng nói, chuyển thành văn bản, xử lý bằng mô hình AI rồi chuyển câu trả lời thành âm thanh. Mỗi công đoạn tạo thêm độ trễ và có thể làm mất một phần ngữ cảnh.
Mô hình mới rút ngắn quy trình này. AI có thể tiếp nhận giọng nói và tạo phản hồi bằng giọng nói trực tiếp, đồng thời xử lý nhiều đặc điểm của cuộc hội thoại như nhịp nói, ngữ điệu và cách phát âm.
Số liệu sử dụng cho thấy thay đổi đang diễn ra nhanh. Google cho biết lượng sử dụng tính năng giọng nói trực tiếp đã tăng gấp đôi trong năm tính đến tháng 4. Các cuộc hội thoại bằng giọng nói với chatbot có độ dài trung bình gấp năm lần so với hội thoại bằng văn bản.
OpenAI cho biết hơn 150 triệu người dùng sử dụng tính năng giọng nói và đọc chép trong ChatGPT mỗi tuần.
Một trong những lĩnh vực chứng kiến sự thay đổi rõ nhất là lập trình. Các công cụ AI như Codex cho phép người dùng mô tả mục tiêu của phần mềm, yêu cầu kỹ thuật và các giới hạn bằng lời nói, sau đó chuyển những thông tin này thành nhiệm vụ cho hệ thống xử lý.
Giọng nói cũng khuyến khích người dùng cung cấp nhiều bối cảnh hơn. Một câu lệnh viết thường được rút gọn để tiết kiệm thời gian. Khi nói, người dùng có xu hướng giải thích mục tiêu, lý do, yêu cầu và tiêu chí đánh giá kết quả trong cùng một mạch hội thoại.
Đây là lợi thế quan trọng khi AI Agent bắt đầu xử lý những nhiệm vụ kéo dài nhiều phút hoặc nhiều giờ. Một dự án phần mềm, kế hoạch nghiên cứu hay quy trình công việc thường cần nhiều vòng trao đổi. Giọng nói giúp người dùng duy trì cuộc hội thoại liên tục trong lúc hệ thống thực hiện nhiệm vụ.
Google và OpenAI cũng đang xử lý những hạn chế từng khiến trợ lý giọng nói khó trở thành công cụ phổ biến. Các mô hình trước đây thường phản hồi chậm, nhận diện sai từ ngữ hoặc gặp khó khăn với giọng địa phương.
Khả năng xử lý của các mô hình ngôn ngữ lớn đã cải thiện đáng kể. Hệ thống hiện có thể duy trì ngữ cảnh lâu hơn, nhận diện nhiều kiểu phát âm và phản hồi linh hoạt hơn trong các cuộc hội thoại kéo dài.
Tuy nhiên, phần cứng đang trở thành một vấn đề quan trọng. Người dùng cần micro đủ nhạy để nhận giọng nói chính xác, đồng thời phải hạn chế tiếng ồn từ môi trường xung quanh.
Các startup tại Thung lũng Silicon đang phát triển nhiều loại micro và thiết bị thu âm mới. Một số sản phẩm được thiết kế để giảm tiếng ồn trong văn phòng, số khác tập trung vào khả năng thu âm ở khoảng cách gần.
Pocket và Plaud phát triển các thiết bị ghi âm nhỏ gọn phục vụ việc ghi chú và tương tác với AI. Sandbar phát triển một chiếc nhẫn cho phép người dùng nói trực tiếp vào thiết bị để ghi chú hoặc đưa ra lệnh.
Những sản phẩm này giải quyết thêm một vấn đề rất đời thường: cảm giác ngượng ngùng khi nói chuyện với AI ở nơi công cộng. Một chiếc điện thoại đặt gần miệng, micro cài áo hoặc thiết bị đeo có thể giúp người dùng tương tác kín đáo hơn.
OpenAI cũng được cho là đang phát triển thiết bị phần cứng đầu tiên của hãng, dự kiến ra mắt vào đầu năm tới. Sản phẩm được mô tả là một trợ lý giọng nói môi trường xung quanh, tích hợp camera, micro và loa.
Dòng vốn đầu tư đang chạy theo xu hướng này. Theo PitchBook, các startup AI giọng nói thu hút 7 tỉ USD vốn đầu tư mạo hiểm trong quý I năm nay, tăng mạnh từ mức chưa tới 1 tỉ USD cùng kỳ năm trước.
Thị trường đang hình thành một cuộc đua mới giữa mô hình AI, phần mềm và thiết bị. Các công ty AI cần làm cho hệ thống hiểu lời nói tốt hơn. Các startup phần cứng cần khiến micro hoạt động chính xác trong nhiều môi trường. Người dùng lại cần một trải nghiệm đủ tự nhiên để duy trì hội thoại trong thời gian dài.
Tolan, startup phát triển giao diện giọng nói kết hợp avatar AI, đang tập trung vào khả năng xử lý tiếng ồn, độ tin cậy của nhận diện giọng nói và phản hồi phù hợp với cảm xúc, ngữ cảnh.
Giọng nói cũng đang thay đổi cách con người giao nhiệm vụ cho AI. Một chatbot có thể trả lời một câu hỏi trong vài giây. Một AI Agent có thể cần hàng chục lần trao đổi để hoàn thành một công việc. Khoảng thời gian tương tác dài hơn khiến chất lượng giao tiếp trở thành yếu tố quan trọng.
Cuộc đua đang chuyển từ việc tạo ra chatbot biết nói sang xây dựng những hệ thống có thể nghe, hiểu và hành động trong một cuộc hội thoại liên tục.
Theo phattrienxanh.baotainguyenmoitruong.vn
https://phattrienxanh.baotainguyenmoitruong.vn/big-tech-bien-giong-noi-thanh-giao-dien-moi-cho-ai-agent-59670.html
Tặng bài viết
Đối với thành viên đã trả phí, bạn có 5 bài viết mỗi tháng để gửi tặng. Người nhận quà tặng có thể đọc bài viết đầy đủ miễn phí và không cần đăng ký gói sản phẩm.
Bạn còn 5 bài viết có thể tặng
Liên kết quà tặng có giá trị trong vòng 7 ngày.
BÀI LIÊN QUAN
Mới nhất
Videos mới nhất