Chính phủ Mỹ đã kiểm tra mô hình AI mới nhất của Trung Quốc bằng các bài kiểm tra tấn công mạng. Kết quả cho thấy Kimi K3 của Moonshot AI còn thua xa các mô hình hàng đầu của Mỹ.
Trung tâm Tiêu chuẩn và Đổi mới AI (CAISI), một cơ quan của Mỹ, đã phối hợp với đối tác tại Anh để thực hiện các bài kiểm tra này. Kết quả được công bố chỉ một ngày sau khi Washington cáo buộc Moonshot đã phát triển Kimi K3 dựa trên công nghệ bị đánh cắp từ Mỹ.
Kimi K3 thua kém tiêu chuẩn an ninh mạng của Mỹ
Bộ Thương mại Mỹ đã công bố kết quả này vào thứ Năm. Theo đó, Kimi K3 bị đánh giá thấp hơn nhiều so với các mô hình AI hàng đầu của Mỹ, dựa trên bài kiểm tra chung với chuyên gia Anh.
Moonshot đã ra mắt Kimi K3 vào ngày 16/07/2026. Nhu cầu quá cao khiến hãng phải tạm ngừng nhận đăng ký mới chỉ sau hai ngày ra mắt.
Sự kiện này cũng khiến cổ phiếu các hãng chip tại Mỹ biến động và làm dấy lên nhiều nghi ngờ về vị thế dẫn đầu của Mỹ trong lĩnh vực AI.
Một bài kiểm tra có tên ExploitBench sử dụng các lỗ hổng thực tế của trình duyệt Chrome, được Đại học Carnegie Mellon phát triển. Kimi K3 đạt 32%, cao hơn GLM-5.2 của Trung Quốc với 24%. Tuy nhiên, các mô hình hàng đầu của Mỹ lại đạt tới khoảng 76%.
Bước khó nhất là làm chủ hoàn toàn một máy tính mục tiêu. Ở phần này, Kimi K3 không thành công trong cả 41 lần thử. Trong khi đó, những mô hình AI tốt nhất của Mỹ lại thực hiện được ở 20 lần kiểm tra.
Một bài kiểm tra khác có tên The Last Ones mô phỏng một cuộc tấn công mạng vào hệ thống công ty giả định với 32 bước. Một chuyên gia phải mất khoảng 20 tiếng để hoàn thành. Kimi K3 chỉ vượt qua trung bình 17 bước. Các mô hình hàng đầu của Mỹ đi tới bước 28.5. Kimi K3 chỉ hoàn thành nhiệm vụ một lần trong 10 lần kiểm tra.
Các hệ thống AI tốt nhất của Mỹ thì hoàn thành tới sáu hoặc bảy lần.
Nhưng khoảng cách có thể không lớn như tưởng tượng
Tuy nhiên, các con số chưa phản ánh hoàn toàn bản chất vấn đề. Những ghi chú chi tiết trong báo cáo cũng lưu ý nhiều điểm quan trọng.
Thứ nhất, các mô hình của Mỹ được kiểm tra khi đã tắt bộ lọc an toàn. Điều này giúp thể hiện toàn bộ sức mạnh của chúng. Trong khi đó, các phiên bản công khai vẫn bật chế độ này. Như vậy, điểm số của Mỹ chỉ là “trong điều kiện lý tưởng”, không phải thực tế ngoài đời.
Đội ngũ kiểm tra cũng thừa nhận đây chỉ là đánh giá ban đầu, trên một số bài kiểm tra nhất định và chưa đầy đủ. Điểm số của Kimi K3 vì vậy chưa hẳn là chính xác cuối cùng. Hơn nữa, một số bài kiểm tra vẫn giữ bí mật nên bên ngoài không thể xác minh độc lập.
Còn có sự khác biệt cơ bản: Kimi K3 là một mô hình mở mà ai cũng có thể tải về dùng và chỉnh sửa, trong khi các mô hình Mỹ là hệ thống đóng, chỉ sử dụng nội bộ. Theo Viện Anh, các mô hình mở thường bị chậm từ bốn đến bảy tháng so với mô hình đóng hàng đầu. Dự kiến bài kiểm tra đầy đủ sẽ chỉ được áp dụng cho Kimi K3 sau khi Moonshot công bố bản hoàn chỉnh tới cộng đồng.
Bên cạnh đó, các bài kiểm tra này không phải là các đợt tấn công thật. Mạng lưới giả lập trong thử nghiệm không có chuyên gia phòng thủ hay hệ thống cảnh báo. Dù vậy, Kimi K3 vẫn vượt qua mô hình mở mạnh nhất trước đó và đã hoàn thành bài tấn công trọn vẹn một lần.
Thời điểm và đơn vị kiểm tra cũng gây chú ý. CAISI tiền thân là Viện An toàn AI Mỹ, được chính quyền Trump đổi tên vào tháng 06/2025. Về cơ bản, đây là bộ phận thuộc Bộ Thương mại Mỹ – nơi quyết định nhiều chính sách hạn chế bán chip cho Trung Quốc. Đáng chú ý, báo cáo về đối thủ Trung Quốc lại được công bố chỉ một ngày sau cáo buộc đánh cắp công nghệ.
Bảo vệ yếu vẫn gây lo ngại
Dù điểm số thấp, điều này không đồng nghĩa Kimi K3 đã an toàn. Thực tế, kiểm tra cho thấy các biện pháp bảo vệ của nó vẫn không ngăn được việc mô hình cố gắng tạo ra tấn công mạng hay phát triển công cụ hack.
Điều này càng đáng quan tâm khi sắp tới Moonshot dự kiến công bố bản đầy đủ vào ngày 27/07/2026. Khi đó, bất kỳ ai cũng có thể tải về, xóa các bộ lọc an toàn và sử dụng tùy ý mà không thể kiểm soát lại.
Kết quả kiểm tra cũng được công bố ngay sau khi xuất hiện cáo buộc đánh cắp công nghệ. Washington cho rằng Moonshot đã tạo ra Kimi K3 từ công nghệ AI Mỹ bị đánh cắp. Giám đốc công nghệ Nhà Trắng, ông Michael Kratsios, cho biết Moonshot đã bí mật sao chép Claude Fable 5 của Anthropic bằng phương pháp chưng cất, nghĩa là huấn luyện mô hình mới dựa trên câu trả lời của mô hình mạnh hơn.
Anthropic xác nhận cáo buộc này. Tháng 02 vừa qua, họ phát hiện hơn 3.4 triệu phiên chat Claude bị Moonshot thu thập qua hàng trăm tài khoản giả. Anthropic cảnh báo các mô hình sao chép sẽ mất đi những kiểm soát an toàn vốn có. Đây cũng chính là điểm yếu mà bài kiểm tra này phát hiện ra.
Mỹ hiện vẫn chi nhiều gấp 23 lần so với Trung Quốc cho AI, nhưng các phòng thí nghiệm Trung Quốc đang rút ngắn khoảng cách rất nhanh. Bài kiểm nghiệm thực sự sẽ chỉ đến vào lúc Kimi K3 ra mắt công khai, khi các chuyên gia độc lập kiểm tra và xác thực năng lực của nó.








