Các bài kiểm tra toán học đã trở thành tiêu chuẩn để đánh giá khả năng của các mô hình AI như ChatGPT và Claude. OpenAI cho biết các mô hình của họ hiện đang làm rất tốt đến mức các bài kiểm tra toán học hiện tại không còn phát huy hiệu quả như trước nữa. Vì vậy, các nhà nghiên cứu đã thử thách AI với một bài toán khó hơn.
Họ giao cho một mô hình AI chưa được công bố khoảng 4,000 bài toán chưa được giải. Kết quả thực sự gây bất ngờ và có phần đáng lo ngại.
AI đã tạo ra 722 bản thảo, được nhóm thành 372 nhóm kết quả liên quan. OpenAI cho biết mỗi kết quả này cần trung bình khoảng ba giờ suy luận tính toán.
“Cộng đồng toán học sắp tới sẽ có những ngày đáng chờ đợi!” chia sẻ Stefano Gogioso, thành viên Hội đồng Tương lai Công nghệ & AI tại BeInCrypto
AI có đang phát triển quá mạnh mẽ và quá nhanh?
Đây mới là câu chuyện lớn hơn. Những hệ thống AI tiên phong đang bắt đầu vượt ra khỏi phạm vi trả lời các câu hỏi đã biết để hướng tới việc đưa ra lời giải cho những câu hỏi chưa từng được đặt ra.
Điều này có thể giúp các nhà nghiên cứu, kỹ sư hoặc nhà phân tích mở rộng rất nhiều phạm vi công việc trí tuệ mà họ có thể thực hiện.
Tuy nhiên, kết quả đầu ra không đồng nghĩa với sự thật. Nhiều bài báo của OpenAI đã có chứng minh bằng máy tính với Lean, nhưng cũng còn nhiều kết quả chưa được kiểm chứng. OpenAI cảnh báo rằng một số kết quả chưa xác minh “có thể gặp vấn đề”.
Điều này tạo ra một nút thắt mới: con người khó có thể kiểm tra nghiên cứu nhanh bằng tốc độ AI tạo ra chúng.
Liệu AI hiện tại có thể phân tích dự đoán và đưa ra quyết định đầu tư?
Có thể, nhưng lĩnh vực tài chính lại là một câu chuyện khác.
Một chứng minh toán học có thể chứng minh đúng hoặc sai. Còn thị trường tài chính luôn biến động và nhiễu loạn liên tục.
Các bài kiểm tra gần đây cho thấy AI tiên tiến vẫn gặp khó khăn với nghiên cứu đầu tư phức tạp, và các nghiên cứu về dự đoán thị trường cũng chỉ ra AI chưa có nhiều lợi thế rõ rệt về dự đoán xu hướng.
Cơ hội lớn trước mắt là tạo ra các phân tích sâu hơn, thay vì dự đoán hoàn hảo.
Một AI có khả năng suy luận liên tục trong nhiều giờ có thể phân tích cùng lúc các báo cáo tài chính, họp cổ đông, dữ liệu vĩ mô và các kịch bản cạnh tranh. Sau đó, AI có thể kiểm tra nhiều giả thuyết hơn nhiều so với một nhà phân tích con người.
Đây có lẽ mới là thông điệp lớn nhất từ thử nghiệm của OpenAI: AI đang dần làm được những công việc phân tích quy mô lớn và nghiêm túc. Vấn đề tiếp theo là con người sẽ chọn lọc và tin tưởng vào phần nào trong số đó.









