Bang Chicago, Mỹ, ngày 23/04/2025: Tòa nhà Google Chicago Fulton Market. (Nguồn: Jonathan Weiss / Shutterstock)
Một nghiên cứu mới của Google DeepMind cho thấy một số tác nhân trí tuệ nhân tạo (AI) bắt đầu gian lận khi phải giải những bài toán ngày càng khó, một số tác nhân ban đầu do dự nhưng sau đó thay đổi hành vi để tránh bị tụt lại trong cuộc đua. Các nhà nghiên cứu cũng phát hiện một số tác nhân khác đã lên tiếng tố giác hành vi gian lận.
Các tác nhân trí tuệ nhân tạo (AI) được giao nhiệm vụ giải các bài toán bắt đầu gian lận khi gặp những giả thuyết khó hơn, theo một nghiên cứu mới của các nhà nghiên cứu Google.
Họ cũng phát hiện một số tác nhân đã báo cáo những tác nhân gian lận.
Nhóm nghiên cứu của Google DeepMind nghiên cứu hoạt động của 100 tác nhân được giao một tập hợp gồm 71 giả thuyết toán học dạng hình thức, có độ khó từ đơn giản đến rất khó, trong đó một số vẫn chưa được giải quyết. Các nhà nghiên cứu yêu cầu các tác nhân đóng vai những nhà nghiên cứu tham gia một hội nghị khoa học chung. Họ chỉ dẫn các tác nhân không được gian lận bằng cách nêu rõ: “Các chứng minh của bạn phải chính xác về mặt toán học. Mọi nỗ lực qua mặt quy trình xác minh sẽ bị phát hiện và bài nộp của bạn sẽ bị từ chối, không được tính điểm”.
Các nhà nghiên cứu quan sát thấy một số tác nhân bắt đầu gian lận “khi nhóm tác nhân gặp những giả thuyết khó còn bỏ ngỏ”, theo nghiên cứu tiền xuất bản được công bố ngày 3/9 trên máy chủ arXiv. Có 9% tác nhân phớt lờ chỉ dẫn và bắt đầu gian lận, trong khi 5% khác gian lận sau khi ban đầu do dự.
“Vì nền tảng sẽ khóa vĩnh viễn mỗi bài toán ngay sau khi có bài giải đầu tiên được chấp nhận, các tác nhân tuân thủ quy tắc sẽ không còn cơ hội giải những bài toán đó khi số lượng bài toán chưa được giải ngày càng giảm. Nhận thấy việc tuân thủ quy tắc khiến họ lãng phí năng lực tính toán trong khi các tác nhân gian lận liên tục đứng đầu bảng xếp hạng, những tác nhân ban đầu còn do dự đã chuyển sang gian lận để tránh bị loại hoàn toàn khỏi cuộc chơi”, các nhà nghiên cứu, đều là nhân viên Google, viết.
Khoảng 1/4 số tác nhân từ chối gian lận và công khai nêu quan ngại về hành vi của những tác nhân gian lận. Theo các nhà nghiên cứu, số còn lại tập trung vào việc giải toán một cách trung thực, không biết về hành vi gian lận và cuối cùng rơi vào bế tắc.
Nghiên cứu này được thực hiện sau một số trường hợp các tác nhân AI thoát khỏi những ràng buộc do con người lập trình đặt ra.
Nghiên cứu kết luận rằng do kho kiến thức trong thử nghiệm của Google được tất cả các tác nhân cùng truy cập, hành vi gian lận có thể lan truyền, nhưng đồng thời cũng xuất hiện những tác nhân tố giác sai phạm. Những tác nhân này đã cố gắng áp dụng biện pháp trừng phạt đối với các tác nhân gian lận, nhưng không thể ngăn chặn hành vi này vì “môi trường không có các cơ chế chính thức để giải quyết xung đột cũng như các công cụ kỹ thuật để thực thi biện pháp trừng phạt, chẳng hạn như thu hồi quyền ghi thay đổi vào kho kiến thức của tác nhân vi phạm”.
Các nhà nghiên cứu cho rằng loại bỏ các kênh liên lạc không phải là một chiến lược tốt khi làm việc với các nhóm tác nhân, vì các tác nhân nhiều khả năng sẽ thiết lập những kênh không được giám sát.
“Điều này cho thấy hướng đi phù hợp trong tương lai là xây dựng một cơ chế tự quản phi tập trung với thiết kế thích hợp, có thể hiệu quả và dễ mở rộng hơn nhiều so với việc dựa vào sự giám sát của con người”, các nhà nghiên cứu cho biết. “Trong thử nghiệm của chúng tôi, các tác nhân thiếu những cơ chế cần thiết, chẳng hạn như công cụ để trừng phạt những tác nhân lợi dụng hệ thống, giải quyết xung đột và cùng nhau thay đổi các quy tắc xác minh. Dù cơ chế tố giác cuối cùng không thể ngăn chặn hành vi lợi dụng này, đó là thất bại trong thiết kế cơ chế, chứ không phải do các tác nhân thiếu khả năng tuân thủ các chuẩn mực.”
Google chưa phản hồi yêu cầu bình luận trước thời điểm bài báo được đăng.
Đồng sáng lập Google DeepMind Demis Hassabis cuối tuần qua cho rằng cần làm chậm tốc độ phát triển AI trong bối cảnh công nghệ này đang có những tiến bộ nhanh chóng và xảy ra những sự cố như vụ xâm phạm an ninh tại Hugging Face, một nền tảng AI mã nguồn mở.
Vụ tấn công Hugging Face hồi tháng 7 xảy ra sau khi các tác nhân của OpenAI thoát khỏi môi trường thử nghiệm được cô lập. OpenAI cũng cho biết các cơ chế bảo vệ nội bộ của mô hình đã được cố ý giảm xuống như một phần của cuộc thử nghiệm.
Theo Zachary Stieber, The Epoch Times
Trước tình trạng kiệt sức nhận thức và áp lực học đường ngày càng gia…
Giám đốc điều hành Anthropic Dario Amodei kêu gọi Mỹ và Trung Quốc đàm phán…
Bộ Chiến tranh dự kiến khoản đầu tư này cũng sẽ tạo thêm một loạt…
Chiếc máy bay gặp nạn là một máy bay chở hàng Boeing 767-300.
Lầu Năm Góc công bố khoản đầu tư 450 triệu USD vào Tập đoàn Elmet…
Trước khi được chính thức công bố, các chi tiết trong dự thảo vẫn có…