OpenAI vừa thêm một “watermark” không nhìn thấy vào văn bản tạo ra bởi ChatGPT và Codex tại Liên minh Châu Âu. Tuy nhiên, thử nghiệm nội bộ cho thấy nếu người dùng chỉ cần đổi 1/4 số từ thành từ đồng nghĩa thì tỷ lệ phát hiện chỉ còn 17%.
Động thái này nhằm đáp ứng quy định mới của EU – Đạo luật AI, yêu cầu mọi văn bản tạo ra bởi AI phải có ký hiệu nhận biết dành cho máy. Tuy vậy, OpenAI thừa nhận công nghệ này còn non trẻ nên công cụ phát hiện của họ hiện tại chưa được công khai cho người dùng.
Độ bền của watermark ChatGPT khi bị chỉnh sửa sẽ như thế nào?
Theo thông báo, hệ thống mới này có tên textGrain, hoạt động bằng cách tinh chỉnh lựa chọn từ của mô hình để tạo ra một mẫu thống kê ẩn. Sau đó, sẽ có một công cụ riêng để quét văn bản và phát hiện mẫu ẩn đó.
Watermark này thực chất nằm ngay trong cách dùng từ, OpenAI giải thích trong phần hỏi đáp. Nó không bổ sung ký tự giấu, ký tự vô hình hay dấu câu lạ. Vì thế, các cách xóa ký tự ẩn thông thường sẽ không có tác dụng.
Độ dài của đoạn văn bản cũng ảnh hưởng khá nhiều. OpenAI đo văn bản bằng đơn vị token – các mảnh từ mà AI xử lý. Một token tương đương khoảng 3/4 một từ tiếng Anh.
Trong thử nghiệm, công cụ phát hiện này nhận ra khoảng 66% nội dung chưa chỉnh sửa có độ dài khoảng 150 từ. Khi văn bản dài khoảng 300 từ, tỷ lệ phát hiện tăng lên khoảng 92%.
Việc chỉnh sửa nhẹ cũng làm watermark ChatGPT yếu đi. Với đoạn 300 từ, nếu đổi 1 từ trong 10 bằng từ đồng nghĩa, tỷ lệ phát hiện giảm từ 92% xuống 66%. Nếu sửa đến 1 phần 4 số từ, khả năng bị phát hiện chỉ còn 17%.
Watermark này hầu như không ảnh hưởng đến điểm chuẩn của GPT-6 Astra của OpenAI – mô hình AI tiên tiến nhất của hãng hiện tại.
Tại sao OpenAI không cho công chúng sử dụng công cụ phát hiện?
Thay vì phát hành công cụ cho tất cả mọi người, OpenAI chỉ tiếp nhận đăng ký từ những nhà nghiên cứu và tổ chức chuyên môn đã được duyệt. Công ty cho biết khi phát hiện watermark, hệ thống không lưu hay tiết lộ thông tin về người dùng, gợi ý hoặc đoạn chat.
Kết quả âm tính cũng chưa nói lên điều gì rõ ràng. Những văn bản ngắn, đã chỉnh sửa hoặc dịch sang ngôn ngữ khác hoàn toàn có thể vượt qua được công cụ phát hiện, chưa kể nội dung làm ra từ các AI khác cũng không bị vướng watermark này.
Việc không phát hiện ra watermark không chứng minh nội dung đó do con người viết ra.
Nguồn: OpenAI
Với hình ảnh và âm thanh, cách kiểm tra lại khác. Bất cứ ai cũng có thể tải các tệp này lên công cụ kiểm tra công khai của OpenAI để xác minh watermark SynthID.
Ngoài khu vực châu Âu, watermark ChatGPT mặc định vẫn được tắt. Tuy nhiên, các khách hàng API trên toàn cầu hiện đã có thể chủ động bật watermark này cho một số mô hình nhất định thông qua cài đặt dự án hoặc tổ chức của họ.
Bước triển khai này xuất hiện sau khi EU chính thức áp dụng quy định minh bạch AI từ tháng 8. Đối với thị trường crypto, vấn đề này càng cấp bách vì tỷ lệ ai bị tội phạm sử dụng đã tăng đến 40% so với năm trước, theo dữ liệu từ TRM Labs.
Như vậy, khoảng cách giữa kỳ vọng của nhà quản lý và khả năng kỹ thuật của công cụ phát hiện sẽ ảnh hưởng lớn đến cách các phòng nghiên cứu AI lớn tuân thủ quy định trong thời gian tới.









