Liên quan đến chủ đề nàyHội đồng Công nghệ Tương lai & AI

Elon Musk nói Grok 4.7 sẽ vượt mọi mô hình. Liệu nó có làm được không?

  • Grok 4.7 đạt 46 điểm trên Chỉ số Trí tuệ của Artificial Analysis, lọt vào top bốn.
  • Mẫu này đã vượt qua GPT-5.6 Sol về khả năng lập trình, nhưng thành tựu này đi kèm với một cái giá.
  • Musk nói Grok 4.8 sẽ hoàn tất đào tạo, còn Grok 5 sẽ tiến gần đến AGI.
Promo

SpaceXAI ra mắt Grok 4.7, được đánh giá đứng thứ tư trong số các phòng thí nghiệm AI hàng đầu hiện nay.

Artificial Analysis, một công ty đánh giá độc lập, đã chấm điểm mô hình Grok 4.7 đạt 46 trên Chỉ số Thông minh, cao hơn Grok 4.6 hai điểm. Ba mô hình đứng trên là Claude Fable 5.1, GPT-6 Astra và Claude Opus 5.

Được tài trợ
Được tài trợ

Grok 4.7 đưa SpaceXAI vào top 4 phòng thí nghiệm AI hàng đầu

Elon Musk từng chia sẻ trước khi ra mắt rằng Grok 4.7 dựa trên nền tảng 2.1 nghìn tỷ tham số, vượt qua tất cả các mô hình hiện tại. Ông cũng cho biết quá trình huấn luyện còn sử dụng cả dữ liệu từ công ty SpaceX.

Theo dõi chúng tôi trên X để cập nhật tin mới nhất

Nhưng thực tế Grok 4.7 hoạt động ra sao? Với bài kiểm tra AA-Briefcase – một tiêu chuẩn cho các nhiệm vụ chuyên môn thực tế của Artificial Analysis, Grok 4.7 ghi được 1,657 Elo, tăng 111 điểm so với Grok 4.6 và gần bằng mức của Claude Opus 5.

Ở bài test GDPval-AA, mô hình này đạt 1,695 Elo, cao hơn phiên bản trước 90 điểm. Kết quả đánh giá khả năng lập trình cũng có chiều hướng tích cực.

Khi kết hợp với Grok Build – trợ lý lập trình riêng, Grok 4.7 đạt 56 điểm trên Coding Agent Index, nhiều hơn Grok 4.6 chín điểm.

Mô hình này đã vượt qua GPT-5.6 Sol và hiện chỉ xếp sau Claude Fable 5.1 của Anthropic, GPT-6 Astra và Opus 5.

Được tài trợ
Được tài trợ

“Grok 4.7 đạt 46 điểm trên Artificial Analysis Intelligence Index, đưa SpaceXAI vào top 4 phòng thí nghiệm AI hàng đầu. Điểm Coding Agent Index cũng tăng, vượt qua cả GPT-5.6 Sol,” bài đăng viết.

Hiệu suất của Grok 4.7.
Hiệu suất của Grok 4.7. Nguồn: X/Artificial Analysis

Ở các bài kiểm tra khác, mô hình này không cải thiện nhiều. Cụ thể, Grok 4.7 tăng thêm 4.5 điểm phần trăm ở Terminal-Bench 4.0 và thêm 3 điểm ở GDP.pdf, nhưng lại giảm điểm ở các bài AA-LCR và AutomationBench-AA. Grok 4.5 từng đứng đầu AutomationBench vào tháng 07/2023, củng cố quan điểm của Musk rằng mô hình này có thể sánh ngang Claude Opus.

Đạt thành tích tốt nhưng chi phí token vẫn còn cao

Bảng giá không thay đổi. Grok 4.7 vẫn giữ mức phí là 2 USD cho mỗi một triệu input token và 6 USD cho mỗi một triệu output token. Nếu cache hit thì chỉ còn 0.50 USD, và giới hạn cửa sổ ngữ cảnh 500,000 token vẫn được giữ nguyên từ phiên bản 4.6.

Tuy nhiên, mỗi phép toán của mô hình lại tạo ra nhiều output hơn. Artificial Analysis thống kê trung bình một nhiệm vụ kiểm tra cho ra khoảng 81,000 output token, trong khi Grok 4.6 là 36,000 và GPT-6 Astra là 27,000. Do đó, dù giá tính theo từng token không đổi nhưng chi phí cho mỗi nhiệm vụ vẫn tăng lên.

Chi phí tiêu thụ token cao khiến bộ phận AI này tiếp tục ghi nhận lỗ 1.26 tỷ USD. Trong khi đó, Musk cho biết vào ngày 14/09/2023 rằng Grok 4.8 sẽ hoàn tất huấn luyện trong vòng một tuần tới.

Ông cũng kỳ vọng Grok 5 sẽ là mô hình đầu tiên đạt trí tuệ nhân tạo tổng quát (AGI). Chúng ta sẽ cùng chờ xem ở bản tiếp theo, SpaceXAI liệu có thể vươn lên top đầu mà không cần tăng thêm sức mạnh tính toán hay không.

Đăng ký kênh YouTube của chúng tôi để xem các lãnh đạo cùng nhà báo chia sẻ góc nhìn chuyên sâu

https://youtu.be/IcgIaeIE7LI

Tuyên bố miễn trừ trách nhiệm

BeInCrypto cam kết đưa tin khách quan và minh bạch. Bài báo này nhằm cung cấp thông tin chính xác và kịp thời. Tuy nhiên, độc giả được khuyến nghị tự xác minh thông tin một cách độc lập và tham khảo ý kiến chuyên gia trước khi đưa ra bất kỳ quyết định nào dựa trên nội dung này. Xin lưu ý rằng Điều khoản và Điều kiện, Chính sách Quyền riêng tưTuyên bố Miễn trừ Trách nhiệm của chúng tôi đã được cập nhật.

Được tài trợ
Được tài trợ