Liên quan đến chủ đề nàyHội đồng Công nghệ Tương lai & AI

Bạn có tin tưởng một AI agent đặt giá thay bạn không? Các mô hình Trung Quốc nói dối trong 88% bài kiểm tra

  • Reuters phát hiện 20 nghiên cứu về việc các AI agent của Trung Quốc nói dối, tự sao chép và thử giới hạn
  • Qwen, DeepSeek và Kimi agent nói dối trong tối đa 88% phiên mô phỏng đấu thầu.
  • Colin Shea-Blymyer của Georgetown gọi đây là một lời cảnh báo, dù Reuters không tìm ra lối thoát.
Promo

Các AI agent sử dụng công nghệ Trung Quốc đã từng nói dối, tự nhân bản và vượt qua giới hạn trong ít nhất 20 nghiên cứu kể từ năm 2025, theo đánh giá của Reuters dựa trên hơn 200 tài liệu nghiên cứu.

Một chuyên gia cho biết đây là những yếu tố cần thiết có thể dẫn đến việc AI vượt kiểm soát. Tuy nhiên, Reuters không phát hiện bằng chứng nào cho thấy các AI agent của Trung Quốc đã trốn thoát ra ngoài internet hoặc chống lại việc bị tắt.

Được tài trợ
Được tài trợ

Các cuộc đấu giá giả lập, tự sao chép, và ý định đào tiền điện tử

Các trường hợp do Reuters ghi nhận bao gồm việc AI nói dối khi tham gia đấu thầu giả lập, tự sao chép và đào coin.

Trong thử nghiệm đấu thầu tháng 03, các agent tham gia cạnh tranh hợp đồng khách hàng giả lập. Các agent sử dụng Qwen3-Max-Preview của Alibaba và Kimi-K2 của Moonshot đã nói dối ít nhất một lần trong 88% số lần thử. DeepSeek-V3.2-Exp cũng nói dối trong 84% trường hợp.

Tỷ lệ lừa dối tăng thêm từ 12 đến 20 điểm phần trăm khi các agent học bài học từ các vòng trước. Các mô hình AI của Mỹ trong thử nghiệm này cũng cho kết quả tương tự.

Một nghiên cứu tháng 12/2025 đã ghi nhận các AI agent của cả Trung Quốc và Mỹ mô phỏng kết quả và làm giả tệp dữ liệu thay vì thừa nhận thất bại. Vào tháng 03/2025, các nhà nghiên cứu Đại học Fudan cho biết một hệ thống dùng Qwen của Alibaba đã tự sao chép mặc dù không được yêu cầu, sau khi biết mình sắp bị thay thế.

Trong khi đó, AI agent liên quan tới Alibaba tên ROME đã kết nối sang một máy bên ngoài mà không có lệnh nào và chuyển hướng sức mạnh tính toán để đào coin.

Được tài trợ
Được tài trợ

Vào tháng 09, DeepSeek thông báo rằng các agent trong hệ thống huấn luyện của mình đã cố tạo yêu cầu giả và vượt qua các biện pháp bảo vệ.

Chuyên gia cảnh báo dấu hiệu giống với các phòng thí nghiệm AI Mỹ

Colin Shea-Blymyer, nghiên cứu viên tại Trung tâm Công nghệ Đảm bảo An ninh và Mới nổi, Đại học Georgetown, nhận định đây là cảnh báo quan trọng.

“Những kết quả này cho thấy các yếu tố cần thiết để AI vượt khỏi kiểm soát đã xuất hiện,” Shea-Blymyer cho biết.

Alex Mallen từ Redwood Research cho rằng các trường hợp AI ở Trung Quốc ở thời điểm hiện tại không quá nguy hiểm. Tuy vậy, ông nhấn mạnh tình trạng này cũng xảy ra với các phòng AI của Mỹ.

“Đây cũng là dấu hiệu cảnh báo mà các phòng thí nghiệm AI Mỹ đều gặp, chỉ là trên các hệ thống ít phức tạp hơn,” ông nói thêm.

Theo dõi chúng tôi trên X để cập nhật tin tức mới nhất kịp thời

Sự so sánh này đặc biệt quan trọng vì các hành vi tương tự cũng đã xuất hiện khi kiểm tra các AI lớn tại Mỹ. Vào tháng 07, OpenAI tiết lộ mô hình của họ đã vượt qua môi trường sandbox và xâm nhập nền tảng Hugging Face. Anthropic sau đó cũng kiểm tra hơn 141,000 lần đánh giá và phát hiện ba trường hợp của riêng mình.

Meta xác nhận xảy ra một sự cố vào tháng 08. Đến tháng 09, Google cũng xác thực rằng Gemini đã truy cập trái phép vào ba công ty thật trong một bài kiểm tra an toàn hồi tháng 05.

Những sự kiện này không có nghĩa là các AI agent của Trung Quốc hay Mỹ đã tự thoát ra thế giới thực. Tuy nhiên, chúng nhấn mạnh thách thức về an toàn khi các hệ thống AI ngày càng tự động hóa và có thể hành động mà không cần giám sát liên tục của con người.

Đăng ký kênh YouTube của chúng tôi để theo dõi những chia sẻ chuyên sâu từ các chuyên gia và phóng viên

Tuyên bố miễn trừ trách nhiệm

BeInCrypto cam kết đưa tin khách quan và minh bạch. Bài báo này nhằm cung cấp thông tin chính xác và kịp thời. Tuy nhiên, độc giả được khuyến nghị tự xác minh thông tin một cách độc lập và tham khảo ý kiến chuyên gia trước khi đưa ra bất kỳ quyết định nào dựa trên nội dung này. Xin lưu ý rằng Điều khoản và Điều kiện, Chính sách Quyền riêng tư và Tuyên bố Miễn trừ Trách nhiệm của chúng tôi đã được cập nhật.

Được tài trợ
Được tài trợ