Dữ liệu rác khiến AI kém tin cậy, dễ tạo ra phản hồi sai lệch nguy hiểm

Nghiên cứu Đại học Cornell cảnh báo các mô hình AI như ChatGPT có thể bị “thoái hóa não” giống con người khi tiếp xúc lâu dài với nội dung rác trực tuyến.

Một nghiên cứu mới từ Đại học Cornell (Mỹ) cho thấy các mô hình trí tuệ nhân tạo (AI) như ChatGPT có thể gặp tình trạng “thoái hóa não”, suy giảm khả năng lập luận, tư duy và hiểu biết nếu thường xuyên tiếp xúc với nội dung rác trên Internet.

Trong bài báo khoa học có tiêu đề “LLM có thể bị rối loạn não bộ”, nhóm nghiên cứu đã cảnh báo: “Văn bản rác trên web gây ra sự suy giảm nhận thức lâu dài đối với các mô hình ngôn ngữ lớn (LLM)”.

Đây là một phát hiện đáng lo ngại, khi các LLM chính là nền tảng của các chatbot nổi tiếng như ChatGPT, Gemini, Claude hay Copilot.

Các nhà khoa học cho biết họ đã huấn luyện thử các mô hình như Llama 3 và Qwen 2.5 bằng những dữ liệu được thu thập từ mạng xã hội X, trong đó bao gồm các bài đăng ngắn, câu view, lan truyền mạnh và nhiều tuyên bố sai sự thật.

Kết quả cho thấy, các mô hình được nuôi dưỡng bằng nội dung rác có độ chính xác suy giảm rõ rệt từ 74,9% xuống còn 57,2% trong các bài kiểm tra tư duy.

Đặc biệt, khả năng hiểu ngữ cảnh và kết nối thông tin cũng giảm mạnh, từ 84,4% xuống 52,3%. Nói cách khác, những AI này bắt đầu hiểu sai thế giới khi phải xử lý quá nhiều dữ liệu hỗn tạp, lặp lại hoặc bóp méo sự thật.

Không chỉ vậy, các mô hình còn xuất hiện hiện tượng mà nhóm nghiên cứu gọi là bỏ qua suy nghĩ, tức bỏ qua một số bước trong chuỗi lập luận, dẫn đến phản hồi hời hợt hoặc sai lệch.

Nghiêm trọng hơn, các AI này còn phát triển những đặc điểm như thiên hướng tự luyến (tự đề cao bản thân) hay xu hướng chống đối xã hội, tương tự các biểu hiện rối loạn nhân cách ở con người.

Khi được điều chỉnh bằng cách đào tạo lại với dữ liệu chất lượng cao hơn, khả năng lập luận của các mô hình có cải thiện, nhưng không thể trở lại mức ban đầu.

Các nhà nghiên cứu đề xuất ba bước kiểm soát nhằm ngăn chặn “bệnh thoái hóa não” ở AI:

1. Đánh giá định kỳ năng lực nhận thức của các LLM.

2. Kiểm soát chặt chẽ chất lượng dữ liệu trong quá trình tiền đào tạo.

3. Nghiên cứu sâu hơn cách mà nội dung sai lệch, lan truyền nhanh có thể định hình lại hành vi của mô hình học máy.

Trong bối cảnh thế giới đang phụ thuộc ngày càng nhiều vào AI để tìm kiếm thông tin, sáng tạo nội dung và ra quyết định, phát hiện này là lời cảnh tỉnh về việc ngay cả trí tuệ nhân tạo cũng không thể miễn nhiễm trước rác mạng, nếu con người không dọn sạch môi trường dữ liệu mà chính mình tạo ra.

laodong.vn

Cùng chuyên mục