Liên quan đến chủ đề nàyHội đồng Công nghệ Tương lai & AI

Mẫu Sonnet mới của Anthropic gần đạt hiệu suất Opus nhưng sử dụng nhiều token hơn

  • Anthropic ra mắt Claude Sonnet 5.5, cho biết phiên bản này chạy nhanh hơn Sonnet 5 hơn 30%.
  • Artificial Analysis xếp nó ở vị trí thứ hai trên Chỉ số Trí tuệ, chỉ sau Opus 5.5.
  • Ở mức hiệu suất tối đa, Sonnet 5.5 sử dụng khoảng 60% lượng output token nhiều hơn so với Opus 5.5.
Promo

Anthropic đã ra mắt Claude Sonnet 5.5 vào ngày 28/09 với mức giá như Sonnet 5. Theo công ty, mẫu AI này hoạt động nhanh hơn hơn 30% và chi phí thấp hơn tối đa 30% cho mỗi nhiệm vụ.

Một công ty kiểm định độc lập lại có kết luận khác về chi phí khi thử đẩy hiệu suất mẫu AI này lên mức tối đa.

Theo dõi chúng tôi trên X để nhận tin tức mới nhất ngay khi vừa có

Được tài trợ
Được tài trợ

Anthropic giới thiệu mẫu 5.5 thứ hai chỉ sau vài ngày ra mắt Opus

Sonnet 5.5 là mẫu AI thứ hai trong dòng Claude 5.5. Anthropic đã ra mắt Opus 5.5 vào ngày 22/09. Cùng ngày đó, OpenAI cũng chính thức trình làng GPT-6 Sol và Luna.

Mẫu AI mới vẫn giữ mức giá của Sonnet 5, là 2 USD cho mỗi triệu input token và 10 USD cho mỗi triệu output token. Theo Anthropic, Sonnet 5.5 đạt điểm 70.6% trên bài kiểm tra Terminal-Bench 4.0, đây là bài đánh giá năng lực lập trình. Sonnet 5 chỉ đạt 10.3%, trong khi Opus 5.5 đạt 66.4%.

“Nếu Opus 5.5 được thiết kế cho công việc phức tạp cần đánh giá kỹ, thì Sonnet 5.5 phù hợp nhất với các tác vụ hàng ngày, sửa lỗi nhanh và tạo tài liệu, slide, hay bảng tính chỉn chu,” đội ngũ bình luận.

Được tài trợ
Được tài trợ

Anthropic cho biết Sonnet 5.5 không mở rộng biên giới về khả năng của dòng Claude. Vì vậy, việc kiểm tra độ an toàn tập trung vào các rủi ro như gây hiểu lầm cho người dùng hoặc bị lợi dụng cho những mục đích lớn và nguy hiểm.

Sonnet 5.5 còn được tích hợp các bộ lọc bảo mật mạng và bộ nhận diện chống sao chép nhằm ngăn chặn việc trích xuất suy luận của mô hình để huấn luyện cho các hệ thống cạnh tranh. Trong vài tuần tới, Claude Haiku 5.5 cũng sẽ được trình làng.

Trong khi đó, OpenAI đã hoãn ra mắt mẫu GPT-6.1 Astra vì lý do an toàn. CNBC xác nhận vào thứ Hai vừa qua rằng mẫu này chưa đáp ứng được chuẩn của công ty.

Artificial Analysis phát hiện Sonnet 5.5 tiêu tốn token nhiều hơn khi làm việc hết công suất

Artificial Analysis, đơn vị kiểm định từng xếp Grok 4.7 ở vị trí thứ tư, đã cho Sonnet 5.5 56 điểm trên Chỉ số Thông minh của họ. Con số này đặt Sonnet 5.5 ở vị trí thứ hai, kém Opus 5.5 hai điểm khi chạy hết mức tối đa.

Đơn vị này ghi nhận Sonnet 5.5 đạt 64% trên bài test Terminal-Bench 4.0, so với 60% ở Opus 5.5 và GPT-6 Astra. Ở các bài kiểm tra dạng kiến thức như GDPval-AA, Sonnet 5.5 có hiệu suất gần bằng Opus 5.5.

Theo họ, Sonnet 5.5 dùng số lượng token đáng kể hơn để đạt kết quả như trên.

“Khi hoạt động hết công suất, đạt hiệu suất gần bằng Opus 5.5, Claude Sonnet 5.5 sử dụng khoảng 193,000 Output token cho mỗi tác vụ của Chỉ số Thông minh,” đơn vị này chia sẻ.

Số lượng này cao hơn khoảng 60% so với Opus 5.5 và Sonnet 5 ở mức tối đa. Thậm chí còn gấp khoảng 7 lần so với GPT-6 Astra khi làm việc hết công suất.

Tuy nhiên, theo chia sẻ các khách hàng dùng thử sớm từ Anthropic, Sonnet 5.5 lại tiêu tốn ít token hơn Sonnet 5 ở các nhiệm vụ khác nhau. Đơn cử, Balyasny Asset Management cho biết lượng token cần thiết cho các tác vụ tài chính giảm hẳn.

“Trong bộ 2,441 tác vụ tài chính riêng tư gồm hỏi đáp, trích xuất, phân tích và dự báo, Claude Sonnet 5.5 không chỉ vượt điểm Sonnet 5 mà còn chỉ dùng khoảng 121,000 token mỗi câu trả lời, trong khi Sonnet 5 cần đến 497,000,” Joe Poirier, Kỹ sư AI cao cấp tại Balyasny Asset Management chia sẻ.

Artificial Analysis đã thử nghiệm bản tiền phát hành của Sonnet 5.5 có lỗi xuất dữ liệu cấu trúc mà Anthropic đã khắc phục. Đơn vị này sẽ tiến hành đánh giá lại trong thời gian tới.

Đăng ký kênh YouTube của chúng tôi để xem các chuyên gia và nhà báo nhận định sâu sắc về lĩnh vực này

Tuyên bố miễn trừ trách nhiệm

BeInCrypto cam kết đưa tin khách quan và minh bạch. Bài báo này nhằm cung cấp thông tin chính xác và kịp thời. Tuy nhiên, độc giả được khuyến nghị tự xác minh thông tin một cách độc lập và tham khảo ý kiến chuyên gia trước khi đưa ra bất kỳ quyết định nào dựa trên nội dung này. Xin lưu ý rằng Điều khoản và Điều kiện, Chính sách Quyền riêng tư và Tuyên bố Miễn trừ Trách nhiệm của chúng tôi đã được cập nhật.

Được tài trợ
Được tài trợ