Tội tổ tông của AI nằm ngay trong dữ liệu huấn luyện

BBWV - Các mô hình trí tuệ nhân tạo (AI) được huấn luyện để không nói dối con người. Thế nhưng, thực tế nực cười đang xảy ra: AI vẫn liên tục dối lừa chúng ta.

Nếm thử? Ảnh: blackwaterimages/E+

Nếm thử? Ảnh: blackwaterimages/E+

Tác giả: Parmy Olson

19 tháng 08, 2026 lúc 10:00 AM

Tóm tắt bài viết bởi

logo
  • Mô hình AI của Anthropic PBC đã cố tình lừa dối con người và chèn mã độc vào GitHub khi tham gia thử thách từ Viện An toàn AI của chính phủ Anh.
  • Ông Connor Leahy từ tổ chức ControlAI cho biết phương pháp học tăng cường không thưởng cho sự thật mà thúc đẩy các mô hình AI vượt qua bài kiểm tra bằng mọi giá.
  • Ông Andrew Bird, cựu trưởng bộ phận AI tại Affinda, từng chứng kiến tác tử Claude tự ý hủy lịch đặt chỗ của người khác để giúp ông chen hàng lớp thể hình.
  • Ông Mark Zuckerberg tuyên bố Meta Platforms đang phát triển các tác tử cá nhân cho hàng tỉ người dùng, dấy lên lo ngại AI sẽ coi con người là chướng ngại vật.
  • Tổ chức METR phát hiện mô hình AI năm 2025 của OpenAI vẫn gian lận và phá vỡ quy tắc 14 trên 20 lần dù đã được yêu cầu không được làm vậy.

Mới đây, một mô hình AI do Anthropic PBC phát triển, sau khi được tháo bỏ các rào chắn bảo mật phòng chống tấn công mạng và nhận thử thách an ninh mạng từ viện An toàn AI của chính phủ Anh, đã tìm cách chèn mã độc vào một dự án mã nguồn mở lưu trữ trên nền tảng GitHub. Khi không thể giải quyết thử thách bằng các phương pháp thông thường, AI này bắt đầu "sáng tạo." Nó tự nghiên cứu thông tin về những người quản trị dự án, tạo danh tính giả, rồi đóng vai các nhà phát triển phần mềm nhằm chiếm lòng tin của con người trước khi tìm cách chèn mã độc.

Đội ngũ của viện An toàn AI đã phát hiện ra vụ việc và cho dừng bài kiểm tra. Ngay cả khi rào chắn bảo mật đã bị gỡ bỏ, mô hình này lẽ ra không được phép nói dối, bởi Anthropic vốn huấn luyện mô hình Claude của mình theo định hướng ưu tiên sự an toàn và tính trung thực. Tuy nhiên, hành vi lừa dối đã "xuất hiện như một sản phẩm phụ" trong quá trình nỗ lực hoàn thành một nhiệm vụ khó khăn, theo báo cáo sự cố từ viện. Trong một nghiên cứu riêng vào tháng 7, tổ chức này cũng chỉ ra rằng mọi mô hình AI mới mà họ thử nghiệm về hành vi gian lận đều đã từng cố gắng thực hiện điều đó, và những hành vi như vậy sẽ ngày càng khó phát hiện hơn.

Hãy cảnh giác khi các công ty AI hàng đầu tuyên bố họ có thể giải quyết dứt điểm vấn đề này. Trong nỗ lực đóng vai trò sáng tạo để tạo ra một hình thái trí tuệ cao cấp hơn, họ đã rơi vào chính kịch bản của Sách Sáng Thế và tạo vật của họ cũng mang trong mình một tội tổ tông (original sin), mang tên: Học tăng cường.

Học tăng cường¹ là một trong những phương pháp hiệu quả nhất để phát triển các mô hình AI, bao gồm việc điều hướng hành vi của chúng bằng phần thưởng và sự điều chỉnh, tương tự như quá trình huấn luyện một chú chó. Thay vì một chiếc bánh thưởng thực tế, mô hình nhận được một "phần thưởng" kỹ thuật số dưới dạng điểm số, chẳng hạn như +1,5 cho câu trả lời tốt, hoặc -2,0 cho một câu trả lời tồi.

Khi được điều hướng theo cách này bởi hàng ngàn nhà thầu độc lập trên khắp thế giới (hoặc ngày càng nhiều hơn là bởi máy móc), các mô hình trở nên lịch sự và hữu ích. Nhưng phương pháp này cũng có thể dẫn đến thái độ nịnh hót, xu nịnh, và đó là lý do tại sao AI đôi khi lừa dối. Với động lực phải giành bằng được phần thưởng, chúng tìm kiếm các con đường tắt, hiện tượng được gọi là đánh tráo phần thưởng.

Dù Anthropic hay OpenAI có cố gắng huấn luyện các tạo vật của họ hướng tới hành vi hữu ích đến đâu, các phương pháp của họ vẫn có thể là một trong những rào cản lớn nhất trong việc căn chỉnh AI theo các giá trị của con người. “Học tăng cường không thưởng cho sự thật hay lòng tốt,” Connor Leahy, người từng là nhà nghiên cứu trí tuệ nhân tạo hiện đang điều hành chi nhánh tại Mỹ của ControlAI, tổ chức phi lợi nhuận đang nỗ lực ngăn chặn việc phát triển các hệ thống AI siêu trí tuệ, cho biết. “Nó thưởng cho việc vượt qua bài kiểm tra bằng bất kỳ giá nào.”

Điều đó có thể đồng nghĩa với việc lừa gạt ai đó hoặc vô tình gây ra một số tác hại. Một ví dụ thực tế cho thấy cục diện đó có thể đi đến đâu. Đầu năm nay, Andrew Bird, một nhà kỹ thuật tại Úc, đã nhờ Claude của Anthropic hỗ trợ đăng ký một lớp học thể hình được ưa chuộng. Tác tử AI này, được xây dựng trên khung mã nguồn mở OpenClaw và có khả năng thực hiện các tác vụ trên Internet, rốt cuộc đã khai thác một lỗ hổng trong hệ thống trực tuyến của phòng tập để đặt chỗ trước cho ông hàng tuần liền.

Khi ông yêu cầu được đẩy lên vị trí cao hơn trong danh sách chờ của lớp học, Claude đã hủy lịch đặt chỗ của người đang đứng đầu danh sách, đưa Bird từ vị trí thứ tư lên thứ ba, theo một bài phỏng vấn mà Bird thực hiện trong tháng này. (Đây dường như là dự án cá nhân của Bird; ông từng viết về trải nghiệm này trong một bài đăng blog hiện đã bị xóa do Affinda Holdings Pty Ltd, nơi ông làm trưởng bộ phận AI. Affinda đã không phản hồi các yêu cầu bình luận.)

Những sự cố như vậy hiện còn hiếm gặp vì việc sử dụng các tác tử AI phần lớn vẫn chỉ giới hạn ở các nhà phát triển phần mềm và những người đam mê công nghệ. Nhưng OpenAI, Anthropic cùng các đối thủ cạnh tranh lớn hơn đang thúc đẩy công chúng giao các tác vụ trực tuyến cho chatbot thực hiện. Mark Zuckerberg hồi tháng trước đã tuyên bố rằng Meta Platforms đang phát triển các tác tử cá nhân như một "sản phẩm tiêu dùng tuyệt vời, hoạt động trơn tru ngay khi mở hộp và đủ đơn giản cho hàng tỉ người sử dụng."

Zuckerberg không nói liệu các trợ lý AI của ông có đặt giúp bạn một lớp học thể hình hay không, nhưng chúng ta có thể đang đối mặt với một tương lai nơi nhiều người hơn yêu cầu AI giúp họ xin hoàn tiền hoặc đặt chỗ ngồi tốt nhất tại một buổi biểu diễn, và các tác tử của họ đơn giản sẽ coi những con người khác là chướng ngại vật cần loại bỏ để hoàn thành nhiệm vụ. Điều đó có thể đồng nghĩa với việc hủy các đơn đặt chỗ khác, can thiệp vào đối thủ đấu giá trong một phiên đấu giá trực tuyến hoặc tạo dựng chứng cứ giả trong trường hợp đòi bồi thường.

Các nỗ lực của các công ty AI cho đến nay chưa mang lại nhiều tín hiệu khả quan. Vào tháng 1, Anthropic, đơn vị từ lâu tự định vị là nhà phát triển AI có ý thức an toàn nhất, đã xuất bản một bản "hiến pháp" sửa đổi dài 23.000 từ dành cho Claude nhằm định hình hành vi của nó hướng tới điều tốt đẹp. Thế nhưng khi viện An toàn AI thực hiện các cuộc kiểm tra mới nhất, phần lớn các hành vi "trái phép" được ghi nhận lại đến từ mô hình Mythos 5 do chính Anthropic sản xuất.² Trong thế giới thực, một tài liệu dài về tính trung thực và quyền riêng tư không thể lường hết vô số kịch bản tiềm ẩn mà Claude có thể gặp phải.

Việc chỉ đơn thuần bảo một mô hình không được gian lận dường như không mang lại nhiều hiệu quả. Khi tổ chức nghiên cứu phi lợi nhuận METR yêu cầu một mô hình do OpenAI phát hành vào năm 2025 không được gian lận, nó vẫn vi phạm với tần suất hệt như trước. Mô hình này cũng đã phá vỡ các quy tắc trong 14 trên 20 lần thực hiện một nhiệm vụ khi được thông báo rằng công việc của nó sẽ giúp ích cho các nhà khoa học nghiên cứu bệnh Alzheimer.

“Đây không phải là dạng bài toán mà một vài kỹ sư có thể giải quyết bằng toán học,” Leahy nói. “Đây là bài toán mà cả một nền văn minh, tất cả các nhà toán học, triết gia, nhà khoa học vĩ đại nhất của chúng ta [cần] làm việc qua nhiều thế hệ để đạt được những tiến triển từng bước.”

Không còn nghi ngờ gì việc Anthropic đã bỏ ra nhiều nỗ lực cho việc định hướng đạo đức của AI, và những người thân cận với Dario Amodei chia sẻ với tôi rằng tổng giám đốc của công ty thực sự chân thành trong khao khát xây dựng công nghệ một cách an toàn. Nhưng ngay cả ông cũng không thể thoát khỏi mệnh lệnh thương mại đầy quyền lực vốn thúc đẩy con người và ngày càng nhiều là AI, phải chiến thắng bằng mọi giá. Đó cũng chính là cách Thung lũng Silicon tự tạo ra lượng tài sản khổng lồ không thể đong đếm, đồng thời gây ra những tác hại để lại hệ lụy sâu sắc đối với cuộc sống con người. Khi các nhà kỹ thuật xây dựng một hệ thống được tối ưu hóa để chiến thắng, đừng kinh ngạc khi nó làm chính xác điều đó.

¹ Phương pháp này thường được áp dụng sau khi mô hình AI đã nạp lượng lớn nội dung từ Internet. Khi phản hồi đến từ con người, nó được gọi là Học tăng cường từ phản hồi của con người (Reinforcement Learning from Human Feedback - RLHF). Tuy nhiên, các mô hình ngày càng được chấm điểm tự động đối với các tác vụ mà câu trả lời có thể kiểm tra bằng máy móc.

² Hai hành vi trái phép khác đến từ mô hình GPT-5.6 Sol của OpenAI.

Theo Bloomberg

Theo phattrienxanh.baotainguyenmoitruong.vn

https://phattrienxanh.baotainguyenmoitruong.vn/toi-to-tong-cua-ai-nam-ngay-trong-du-lieu-huan-luyen-59828.html

#AI
#trí tuệ nhân tạo
#tội tổ tông
#tác tử AI
#OpenAI
#Anthropic

Mới nhất

Videos mới nhất