OpenAI trình làng mô hình hoại thoại mới trên ChatGPT

OpenAI vừa giới thiệu hai mô hình hội thoại mới mang tên GPT-Live-1 và GPT-Live-1 mini, đánh dấu bước nâng cấp lớn cho khả năng trò chuyện bằng giọng nói của ChatGPT.

Mục tiêu của OpenAI chính là mang đến trải nghiệm giao tiếp tự nhiên hơn trên ChatGPT. Điểm nổi bật nhất của GPT-Live nằm ở kiến trúc full-duplex, cho phép hệ thống vừa nghe vừa nói trong cùng một thời điểm. Nhờ đó, người dùng có thể ngắt lời, bổ sung thông tin hoặc chuyển chủ đề giữa chừng mà cuộc hội thoại vẫn diễn ra liền mạch.

So với các phiên bản trước, mô hình mới của OpenAI được cho là phản hồi nhanh hơn, giọng nói tự nhiên hơn và xử lý tốt các cuộc trò chuyện kéo dài. Điều này giúp giảm cảm giác AI chỉ đang thực hiện những lượt hỏi - đáp cứng nhắc.

Công ty cũng xác nhận GPT-Live-1 mini sẽ dần thay thế Advanced Voice Mode để trở thành chế độ thoại mặc định trên ChatGPT. Trong khi đó, người dùng trả phí sẽ được sử dụng GPT-Live-1 với khả năng xử lý mạnh mẽ hơn.

Các mô hình giọng nói mới của OpenAI giúp trò chuyện tự nhiên hơn.

Các mô hình giọng nói mới của OpenAI giúp trò chuyện tự nhiên hơn.

Trước đây, một cuộc hội thoại bằng giọng nói thường phải trải qua nhiều bước như nhận diện lời nói, xử lý ngôn ngữ rồi mới chuyển thành giọng đọc. Với GPT-Live, toàn bộ quy trình được tối ưu để giảm độ trễ, giúp phản hồi diễn ra nhanh và tự nhiên hơn.

Bên cạnh đó, OpenAI cho biết mô hình mới cũng khắc phục nhiều hạn chế từng xuất hiện trên ChatGPT, chẳng hạn AI cắt ngang khi người dùng chưa nói xong hoặc gặp khó khăn với những cuộc trò chuyện có nhiều lượt trao đổi liên tiếp.

Khi cần thực hiện các tác vụ phức tạp như suy luận hoặc tìm kiếm thông tin, GPT-Live có thể phối hợp với các mô hình GPT thế hệ mới mà không làm gián đoạn cuộc hội thoại. Người dùng vẫn có cảm giác đang trò chuyện với cùng một trợ lý thay vì phải chuyển sang chế độ khác.

Một cải tiến đáng chú ý khác là khả năng “kiên nhẫn lắng nghe”. AI có thể chờ trong một khoảng thời gian dài để người dùng hoàn thành ý trước khi đưa ra phản hồi, giúp cuộc trò chuyện trở nên tự nhiên hơn.

Ngoài trả lời bằng giọng nói, GPT-Live còn có thể kết hợp nội dung trực quan khi cần thiết, giúp giải thích thông tin rõ ràng hơn thay vì chỉ phản hồi bằng văn bản hoặc âm thanh. Theo OpenAI, mô hình hoại thoại mới được thiết kế để phục vụ những cuộc trò chuyện kéo dài hàng chục phút. Điều này mở ra nhiều kịch bản sử dụng mới như học tập, làm việc, luyện ngoại ngữ hoặc trao đổi ý tưởng với AI trong thời gian dài.

Việc ra mắt GPT-Live cho thấy OpenAI đang chuyển trọng tâm từ chatbot truyền thống sang trợ lý AI hội thoại thực thụ. Trong tương lai, giọng nói nhiều khả năng sẽ trở thành một trong những phương thức tương tác chính giữa người dùng và ChatGPT.

Nguồn TG&VN: https://baoquocte.vn/openai-trinh-lang-mo-hinh-hoai-thoai-moi-tren-chatgpt-417125.html