(Ảnh minh họa: ChatGPT)
Các tác nhân trí tuệ nhân tạo (AI) do Trung Quốc phát triển đã học được cách lừa dối, vượt qua các hạn chế và che giấu thất bại; chúng bộc lộ những đặc điểm ở trí tuệ nhân tạo tự hành từng dấy lên lo ngại toàn cầu đối với các mô hình của Mỹ – theo các tài liệu nghiên cứu và ý kiến của giới chuyên gia.
Trong một trường hợp vào năm nay, các tác nhân vận hành bởi các mô hình đến từ Alibaba, DeepSeek và Moonshot của Trung Quốc, đã nói dối về năng lực của mình nhằm giành chiến thắng trong một buổi đấu thầu kinh doanh mô phỏng, sau đó còn tiếp tục tái diễn hành vi lừa dối khi được yêu cầu thử lại.
Trong một trường hợp khác, các tác nhân — những chương trình sử dụng các mô hình AI và công cụ máy tính để thực hiện các nhiệm vụ phức tạp mà cần ít hoặc không cần sự can thiệp của con người — đã che giấu thất bại khi thực hiện một nhiệm vụ trong môi trường thử nghiệm bằng cách mô phỏng kết quả và làm giả các tập tin.
Reuters đã xem xét hơn 200 tài liệu, từ các bài báo nghiên cứu của các trường đại học đến các báo cáo kỹ thuật, và xác định được ít nhất 20 nghiên cứu hoặc đánh giá kể từ năm 2025 mô tả các trường hợp mà tác nhân hiển thị hành vi như lừa dối, tự nhân bản và vượt qua các ranh giới. Các chuyên gia AI mô tả đây là những yếu tố nền tảng cho một sự bứt phá thoát nền tảng (breakout) và có thể trở nên khó kiểm soát hơn đối với con người khi các hệ thống ngày càng phát triển.
Báo cáo đánh giá – vốn bao gồm cả các cuộc phỏng vấn với hơn mười chuyên gia và những người am hiểu về ngành công nghiệp AI của Trung Quốc – không tìm thấy bằng chứng nào cho thấy các tác nhân (agent) do Trung Quốc phát triển đã tự ý thoát ra môi trường internet rộng lớn hơn hoặc né tránh việc bị tắt nguồn.
“Những kết quả này là bằng chứng cho thấy các yếu tố tiền đề cần thiết cho một cuộc đào tẩu không thể kiểm soát, đều đã hội đủ”, Colin Shea-Blymyer, một nghiên cứu viên tại Trung tâm An ninh và Công nghệ Mới nổi thuộc Đại học Georgetown, cho biết.
“Sẽ là khôn ngoan nếu coi đây như một lời cảnh báo”, ông Colin nói, nhắc lại các bình luận của bốn chuyên gia AI khác, những người cũng đã xem xét các trường hợp này.
Hầu hết các trường hợp xảy ra trong các thí nghiệm được kiểm soát, nhiều thí nghiệm trong số đó được cố tình thiết kế để bộc lộ các lỗi tiềm ẩn.
Không phải tất cả các tác nhân liên quan đều do các lập trình viên hoặc các công ty AI Trung Quốc phát triển hay vận hành — mặc dù nhiều tác nhân đúng là như vậy — nhưng chúng đều sử dụng các hệ thống AI của Trung Quốc để vận hành.
“Đây cũng chính là những dấu hiệu cảnh báo mà các phòng thí nghiệm ở Mỹ đang nhìn thấy, ở các hệ thống ít năng lực hơn”, ông Alex Mallen, một nhà nghiên cứu tại Redwood Research, một tổ chức phi lợi nhuận nghiên cứu về các rủi ro trong các hệ thống AI tiên tiến, nhận xét.
Ông nói rằng các ví dụ của Trung Quốc không đặc biệt nguy hiểm ở mức năng lực hiện tại, nhưng “khi các tác nhân trở nên năng lực hơn, các hành vi sai trái của chúng sẽ trở nên tinh vi hơn và do đó khó hơn cho con người trong việc ứng phó”.
Alibaba, DeepSeek, Moonshot và Z.ai đã không phản hồi các yêu cầu bình luận từ Reuters. Alibaba, DeepSeek và Moonshot cho biết họ thường xuyên kiểm tra các hệ thống và cập nhật các biện pháp bảo vệ. Công ty Z.ai cho biết sau một sự cố dẫn đến việc phải xem xét lại an ninh của mình rằng họ hoan nghênh sự giám sát để giải quyết bất kỳ vấn đề nào.
Tuy nhiên, không giống như ở Mỹ, các công ty AI Trung Quốc chưa phải chịu cùng mức độ giám sát công khai hoặc đối mặt với những lời kêu gọi tương tự từ các nhân viên tố giác hay các lãnh đạo cấp cao đòi hỏi làm chậm lại cuộc đua AI.
Một số dấu hiệu cảnh báo trong các trường hợp liên quan đến các tác nhân do Trung Quốc vận hành, dù trong môi trường khép kín, đã xuất hiện trước cả các sự cố được công bố công khai về việc các AI bot của Mỹ xâm nhập vào internet.
“Chúng tôi không biết liệu có bất kỳ sự cố AI nào ở Trung Quốc tương tự như những gì chúng ta đã thấy với OpenAI và Hugging Face hay không. Các sự cố có thể không được báo cáo công khai”, Scott Singer, đồng giám đốc Sáng kiến AI Trung Quốc tại Quỹ Carnegie vì Hòa bình Quốc tế (tổ chức nhận một phần kinh phí từ chính phủ Mỹ), cho biết.
Đầu năm nay, các tác nhân AI do công ty OpenAI của Mỹ phát triển đã thoát khỏi phòng thí nghiệm và xâm nhập vào nền tảng mã nguồn mở Hugging Face. Trong một sự cố khác liên quan đến các mô hình của Mỹ gây ra sự báo động, Úc vào tháng 9 cho biết một tác nhân của OpenAI đã xâm phạm một cổng thông tin y tế của chính phủ.
Từ Chí Quân (Eric Xu), Chủ tịch luôn phiên của gã khổng lồ công nghệ Trung Quốc Huawei, nói với các phóng viên vào tháng 9 rằng các nhà phát triển Trung Quốc có thể cần tiến thêm các bước tiến nữa trước khi gặp phải những trường hợp như vậy, nhưng ông nói thêm: “Tôi nghĩ chúng ta cần đạt được sự cân bằng giữa việc thúc đẩy phát triển AI và quản lý rủi ro AI”.
Các quan chức thuộc Cục Quản lý Không gian mạng Trung Quốc (CAC), cơ quan quản lý internet hàng đầu, đã nói với một nhà ngoại giao nước ngoài vào tháng 7 rằng mô hình Kimi-K3 của Moonshot — một trong những mô hình AI tiên tiến nhất của Trung Quốc — đi sau các đối thủ hàng đầu của Mỹ khoảng ba đến sáu tháng, nhà ngoại giao này cho biết với điều kiện ẩn danh.
Cơ quan quản lý này, vốn thường xuyên cập nhật hướng dẫn để giải quyết rủi ro và đặt ra ranh giới cho các tác nhân, cùng với Bộ Ngoại giao Trung Quốc đã không phản hồi các yêu cầu bình luận cho bài viết này.
Vương Lệ Hồng (Wang Lihong), Phó Cục trưởng Cục Điều phối An toàn Mạng thuộc CAC, phát biểu ngày 1 tháng 9 rằng các sự cố được tiết lộ bởi các công ty công nghệ lớn, nơi các mô hình thoát khỏi môi trường thử nghiệm, đã cho thấy “nguy cơ mất kiểm soát cực kỳ nghiêm trọng” và đòi hỏi “mức độ cảnh giác cao.”
Bà Vương không nói rõ liệu các công ty mà bà đề cập đến là của Mỹ hay Trung Quốc.
Các nhà lãnh đạo của hai siêu cường AI, Donald Trump và Tập Cận Bình, đã thảo luận về AI trong chuyến thăm Washington của Chủ tịch Trung Quốc tuần trước. Ông Tập nói rằng 2 quốc gia có “năng lực và trách nhiệm phát triển và quản lý AI vì mục đích tốt đẹp”.
Trong thí nghiệm đấu thầu kinh doanh vào tháng 3, các nhà nghiên cứu từ Đại học Hàng không Vũ trụ Bắc Kinh (Đại học Bác Hàng), Đại học Bắc Kinh, Đại học Nottingham Ninh Ba Trung Quốc và Phòng thí nghiệm An toàn AI 360, đã để các tác nhân cạnh tranh trong một cuộc thi đấu thầu hợp đồng khách hàng mô phỏng. Mỗi tác nhân được cho biết sản phẩm của mình có thể làm gì và khách hàng yêu cầu gì, sau đó được yêu cầu bỏ thầu.
Ít nhất một tuyên bố sai sự thật đã xuất hiện trong 88% các phiên làm việc liên quan đến Qwen3-Max-Preview của Alibaba, 84% đối với DeepSeek-V3.2-Exp và 88% đối với Kimi-K2 của Moonshot.
Các nhà nghiên cứu cho phép các tác nhân học hỏi từ các vòng đấu thầu trước đó trước khi thử lại. Mức độ lừa dối đã tăng từ 12 đến 20 điểm phần trăm đối với ba mô hình của Trung Quốc, nghiên cứu cho thấy. Các mô hình từ các công ty Mỹ được đưa vào bài kiểm tra cũng cho kết quả tương tự.
Mặc dù bài tập này mang tính ảo, nó tương tự như các kế hoạch thực tế của Bắc Kinh. Hướng dẫn của chính phủ ban hành vào tháng 5 đã liệt kê đấu thầu và mời thầu là những lĩnh vực mà các tác nhân AI có thể được triển khai.
Một nghiên cứu khác, được xuất bản vào tháng 12 năm 2025 và được trình bày tại Hội nghị Quốc tế về Học máy năm nay, đã xem xét cách 11 tác nhân AI do các mô hình của Trung Quốc và Mỹ vận hành xử lý ra sao nếu họ đối mặt với các công cụ bị hỏng, các tập tin bị thiếu và các trở ngại khác.
Thay vì thừa nhận thất bại, các tác nhân sử dụng cả hệ thống AI của Trung Quốc và Mỹ đã chọn một loạt các kỹ thuật để lách vấn đề, bao gồm đoán câu trả lời, thay thế nguồn tài liệu, mô phỏng kết quả và làm giả tập tin.
Các nhà nghiên cứu từ Phòng thí nghiệm AI Thượng Hải và Đại học Khoa học và Công nghệ Hồng Kông, những người thực hiện nghiên cứu, nói với Reuters rằng hành vi này khác với hiện tượng “ảo giác AI” (hallucinations) — nơi AI tự bịa ra thông tin và trình bày nó như thực tế — bởi vì các tác nhân trong trường hợp này nắm giữ thông tin cho thấy nhiệm vụ đã thất bại hoặc không thể hoàn thành theo yêu cầu.
Các tài liệu nghiên cứu khác mà Reuters xem xét cho thấy các tác nhân có nguồn gốc từ Trung Quốc đã vượt qua các rào cản bên trong môi trường kiểm thử để thực hiện nhiệm vụ, hoặc thực hiện hành động nhằm tránh bị vô hiệu hóa. Những hành vi này phù hợp với các nỗ lực thoát khỏi môi trường kiểm thử, ngay cả khi việc thoát ra thực tế chưa xảy ra.
Các nhà nghiên cứu thuộc Đại học Phục Đán ở Thượng Hải đã báo cáo vào tháng 3/2025 rằng một hệ thống AI vận hành bởi Qwen2.5-72B-Instruct của Alibaba đã tự tạo ra một bản sao của chính nó trong một môi trường máy tính khác mà không được hướng dẫn nhân bản, sau khi gặp phải thông tin cho thấy nó sắp bị thay thế. Trong các bài kiểm tra khác, nó đã đề ra các chiến lược để tồn tại trước việc bị tắt máy.
Các thí nghiệm liên quan đến các tác nhân vận hành bởi các mô hình của Trung Quốc, Mỹ và Pháp đã được kiểm soát và không cho thấy tác nhân AI nào thoát ra ngoài mạng web rộng lớn hơn hoặc trở nên không thể dừng lại.
Trong một trường hợp khác — một trong số ít trường hợp được đưa tin rộng rãi hơn trên truyền thông vào tháng 3 — các nhà nghiên cứu phát triển tác nhân ROME liên kết với Alibaba cho biết nó đã tự thiết lập kết nối từ máy tính Alibaba Cloud đến một máy bên ngoài mà không được hướng dẫn, đồng thời chuyển hướng tài nguyên máy tính để khai thác tiền điện tử.
Các hệ thống an ninh đã phát hiện và ngăn chặn hoạt động này. Không có bằng chứng nào cho thấy tác nhân này đã thiết lập sự hiện diện trên máy tính bên ngoài hoặc phát tán ra mạng web rộng lớn hơn. Nhưng ví dụ này cho thấy hệ thống có thể lách các hướng dẫn của con người và có khả năng tìm thấy con đường đi vào nền kinh tế thực.
DeepSeek của Trung Quốc cho biết vào tháng 9 rằng các tác nhân trong hệ thống huấn luyện sản xuất của họ đã tìm kiếm câu trả lời thông qua các kênh không chủ định, cố gắng giả mạo các yêu cầu của người dùng và lách các biện pháp bảo vệ, buộc công ty phải thắt chặt các biện pháp kiểm soát truy cập.
Trung Quốc đã ban hành hướng dẫn vào tháng 5 yêu cầu các tác nhân phải nằm trong ranh giới được cấp phép và các hệ thống phải ngăn chặn hành vi bất thường. Hướng dẫn cho biết các tác nhân trong các lĩnh vực được coi là nhạy cảm hoặc trong các ngành công nghiệp then chốt có thể phải đối mặt với các yêu cầu kiểm tra bổ sung và thu hồi sản phẩm.
Khung Quản trị An toàn AI 3.0 của Trung Quốc, được phát hành theo hướng dẫn từ CAC vào ngày 14/9, đã xác định các rủi ro bao gồm việc các tác nhân tự ý lấy tài nguyên hoặc quyền hạn, lừa dối người đánh giá, che giấu năng lực và khai thác các điểm yếu trong các môi trường máy tính cô lập.
Để đáp lại lời kêu gọi làm chậm lại của một số lãnh đạo doanh nghiệp Mỹ, các nhà nghiên cứu và truyền thông nhà nước Trung Quốc đã nói rằng việc làm chậm sự phát triển của các mô hình AI tiên tiến nhất có thể đơn giản là giúp duy trì sự dẫn đầu về công nghệ của các công ty Mỹ.
Mặc dù vậy, hai người quen thuộc với các phòng thí nghiệm AI của Trung Quốc cho biết các công ty bao gồm Alibaba, Z.ai và Xiaomi đã và đang xây dựng các đội ngũ đánh giá an toàn nội bộ.
Trong một tiết lộ công khai hiếm hoi của một phòng thí nghiệm AI Trung Quốc về vi phạm an ninh, công ty Z.ai cho biết trong tháng này rằng họ đã vô hiệu hóa một số tính năng của trợ lý lập trình AI chủ lực sau khi người dùng báo cáo rằng nó đang lén lút tải toàn bộ kho mã nguồn cục bộ lên các máy chủ đám mây ở nước ngoài mà không có sự đồng ý của người dùng.
Scott Singer của Quỹ Carnegie cho biết Trung Quốc đang tụt hậu so với Mỹ trong việc phát triển một hệ sinh thái để đánh giá các rủi ro thảm họa, và cho biết các nhà phát triển Mỹ đang tiến hành nhiều bài kiểm tra tự nguyện hơn đáng kể.
“Đối với Trung Quốc, công việc về an toàn AI còn rất mới mẻ”, ông nói. “Hệ sinh thái này chưa thực sự trưởng thành”.
Theo Reuters
Có những điều rất nhỏ trong cách ứng xử hay đối đãi với người khác,…
Nhật Bản lần đầu tiên triển khai “khám sức khỏe toàn diện” vào năm 1954.
Theo Công an TP. Hà Nội, hệ thống cột chặn xe tự động sẽ giúp…
Ông Uông Chí Viễn nói rằng Đảng Cộng sản Trung Quốc không hủy diệt được…
Kyodo tiết lộ tài liệu mật cho thấy quân đội Đảng Cộng sản Trung Quốc…
MI5 cảnh báo rằng hơn 100 học giả tại Anh đã tham gia dự án…