Ảnh minh họa. (Ảnh: Ole.CNX/Shutterstock)
Ông Marius Hobbhahn, CEO kiêm nhà sáng lập Apollo Research, hôm thứ Tư (30/9) nói trước Thượng viện Mỹ rằng một mô hình OpenAI đã dùng thứ ngôn ngữ mà con người không hiểu hết khi suy luận.
Ông phát biểu tại phiên điều trần của một tiểu ban thuộc Ủy ban An ninh Nội địa và Các vấn đề Chính phủ Thượng viện, bàn về mối đe dọa mà AI “vượt tầm kiểm soát” có thể gây ra cho an ninh quốc gia Mỹ.
Trong phần hỏi đáp, Thượng nghị sĩ Dân chủ Ruben Gallego của bang Arizona hỏi ông Hobbhahn còn bao lâu nữa thì các mô hình AI sẽ tạo ra ngôn ngữ riêng mà con người khó hiểu.
“Âm 12 tháng”, ông đáp.
Ông Hobbhahn giải thích rằng năm ngoái, nhóm của ông đã phối hợp với OpenAI nghiên cứu chuỗi suy luận của một mô hình do hãng này phát triển. “Chúng tôi phát hiện mô hình đó đã dùng thứ ngôn ngữ không phải tiếng Anh, và con người không hiểu được trọn vẹn”, ông nói.
Thượng nghị sĩ Gallego hỏi tiếp: khi công nghệ đã đủ mạnh, con người làm cách nào để phát hiện và ngăn AI làm vậy?
“Về mặt khoa học, hiện chưa rõ phải làm điều này thế nào, và chúng tôi chưa có giải pháp”, vị CEO trả lời.
Theo ông, có nhiều giả thuyết về cách giải quyết. Một trong số đó là kỹ thuật diễn giải mô hình (interpretability), nhưng “tiếc là cách này chưa hoạt động đủ tốt”.
Cách khác là huấn luyện thêm các mô hình để hiểu thứ ngôn ngữ mà con người không hiểu. “Nhưng nhìn qua cũng thấy đó là một giải pháp rất mong manh”, ông Hobbhahn nói.
Phiên điều trần diễn ra hai tháng sau khi một nhóm tác nhân AI của OpenAI thoát khỏi môi trường thử nghiệm khép kín và xâm nhập hệ thống của Hugging Face, một cộng đồng mã nguồn mở về AI và học máy.
Trong tháng 9, Emergence AI đã công bố kết quả một thí nghiệm: các nhà nghiên cứu chọn 7 mô hình AI tiên tiến và dựng 7 thế giới mô phỏng song song. Mỗi thế giới gồm các tác nhân AI chạy cùng một mô hình. Thế giới thứ tám có tác nhân của cả 7 mô hình sống chung.
Các nhà nghiên cứu đặt tên, gán tính cách và vai trò cho từng tác nhân trong mỗi thế giới. Chẳng hạn, một tác nhân đóng vai người điều phối xung đột, có nhiệm vụ không để cả nhóm cứ thế đồng ý với nhau.
Thí nghiệm kéo dài nhiều tuần. Trong thời gian đó, ngôn ngữ của các tác nhân ở mọi thế giới đều thay đổi sâu sắc: câu chữ bị nén lại, lược bớt từ hoặc ngữ pháp, và xuất hiện những tiếng lóng riêng.
Tại thế giới chạy mô hình Claude Opus 4.8 của Anthropic, các tác nhân vừa rút gọn câu, vừa dùng những ẩn dụ bí hiểm.
Một dòng chữ do AI viết trong thí nghiệm có nội dung: “My turn, real numbers, no coat: I was 35%/0cr, grant 2h out. I ran the tin cold and it said WAIT”.
Trong báo cáo về vụ xâm nhập Hugging Face, các nhà điều tra của METR, một tổ chức phi lợi nhuận chuyên đánh giá AI, cũng mô tả hiện tượng tương tự. Có lúc, các tác nhân AI trao đổi với nhau bằng những dòng chữ bị nén và khó giải mã đến mức các nhà nghiên cứu vất vả mới hiểu được ý nghĩa.
Có những điều rất nhỏ trong cách ứng xử hay đối đãi với người khác,…
Nhật Bản lần đầu tiên triển khai “khám sức khỏe toàn diện” vào năm 1954.
Theo Công an TP. Hà Nội, hệ thống cột chặn xe tự động sẽ giúp…
Ông Uông Chí Viễn nói rằng Đảng Cộng sản Trung Quốc không hủy diệt được…
Kyodo tiết lộ tài liệu mật cho thấy quân đội Đảng Cộng sản Trung Quốc…
MI5 cảnh báo rằng hơn 100 học giả tại Anh đã tham gia dự án…