Google đã ra mắt Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking vào ngày 15/09/2024, gọi đây là những mô hình âm thanh tiên tiến nhất của hãng cho đến nay.
Hai mô hình này có khả năng trò chuyện, suy luận và xử lý nhiều nhiệm vụ khác nhau. Nhưng các nhà phân tích độc lập đánh giá chúng thế nào? Phiên bản Extended Thinking đã dẫn đầu Chỉ số Speech-to-Speech của Artificial Analysis với điểm số 82.6, vượt qua GPT-Live-1 và Grok Voice.
Theo dõi chúng tôi trên X để nhận tin tức mới nhất ngay khi sự kiện diễn ra
Bảng xếp hạng các chỉ số đánh giá mô hình AI trò chuyện mới nhất của Google
Chỉ số của Artificial Analysis chấm điểm dựa trên khả năng suy luận bằng giọng nói, hiệu suất tác vụ, mức độ được yêu thích và tỷ lệ hoàn thành nhiệm vụ.
Gemini 3.8 Live Extended Thinking, được kiểm tra ở mức nỗ lực suy luận cao, đã ra mắt ở vị trí số một. Tiếp theo là GPT-Live-1 Astra với 81.5 điểm và Grok Voice Think Fast 2.0 High với 81.3 điểm.
Phiên bản tiêu chuẩn Gemini 3.8 Live xếp hạng năm với số điểm là 76.0. Cả hai phiên bản mới đều vượt qua Gemini 3.1 Flash Live High, vốn chỉ đạt 71.5 điểm.
Khoảng cách về khả năng xử lý tác vụ cũng đáng kể. Extended Thinking đạt 68.6% trên bảng xếp hạng Tau Voice, trong khi thế hệ trước chỉ đạt 37.7%.
Ở bài kiểm tra về suy luận giọng nói, Extended Thinking ghi được 97.7%, nhỉnh hơn Grok Voice với 97.2%. Tuy nhiên, vẫn thấp hơn Qwen Audio 3.0 Realtime Plus, đạt 99.2%.
Người dùng thử nghiệm vẫn ưu tiên mô hình Gemini cũ
Giá cả là yếu tố tạo ra sự khác biệt. Phiên bản tiêu chuẩn có chi phí 0.84 USD/giờ cho mỗi giờ âm thanh đầu vào, bằng xấp xỉ một nửa so với phiên bản tiền nhiệm (1.75 USD) và thấp nhất trong số các mô hình được so sánh.
Phiên bản Extended Thinking có giá 3.50 USD/giờ, rẻ hơn so với GPT-Live-1 Sol (4.47 USD/giờ) và Grok Voice Think Fast 2.0 High (4.80 USD/giờ).
Độ trễ cũng đã được cải thiện. Thời gian trung bình để tạo ra âm thanh đầu tiên chỉ còn 1.18 giây, so với 2.99 giây của mô hình Gemini đời trước.
Dù vậy, người dùng nghe thử vẫn chưa thực sự bị thuyết phục. Gemini 3.1 Flash Live hiện vẫn dẫn đầu về mức độ yêu thích trong so sánh mù tại các cuộc hội thoại Speech Agent Arena, đạt điểm Elo 1096.
Gemini 3.8 Live đứng thứ hai với điểm số 1083. Biến thể Extended Thinking xếp sau với 990 điểm, dù hoàn thành tới 89.1% nhiệm vụ được giao.
Các AI sử dụng giọng nói giờ đây đang được đánh giá trên hai tiêu chí khác nhau. Các bảng xếp hạng ưu tiên khả năng suy luận, còn sự yêu thích của người dùng lại nghiêng về độ tự nhiên khi trò chuyện. Hiện tại, Google đang dẫn đầu cả hai bảng với các mô hình khác nhau.
Đăng ký kênh YouTube của chúng tôi để xem các nhà lãnh đạo và phóng viên chia sẻ góc nhìn chuyên sâu









