Nhân viên Microsoft gọi việc AI thu thập dữ liệu là vụ trộm lao động lớn nhất

Tài liệu tòa án vụ NYT kiện OpenAI tiết lộ nhân viên Microsoft tranh luận rằng việc AI huấn luyện trên nội dung tin tức là vụ trộm lao động lớn nhất lịch sử.

Eliza Crichton-Stuart

Eliza Crichton-Stuart

Đã cập nhật

Microsoft Staff Debated AI Scraping as Massive Labor Theft
Quảng cáo

"Hàng triệu người trên khắp thế giới sẽ sớm coi việc các mô hình lớn 'hút' cạn toàn bộ thành quả lao động của họ là một vụ trộm đáng kinh ngạc với quy mô chưa từng có."

Câu nói đó không đến từ một nhà phê bình bên ngoài. Nó đến từ chính nội bộ Microsoft.

Các tài liệu tòa án được công bố trong tuần này liên quan đến vụ kiện bản quyền của New York Times chống lại OpenAIMicrosoft đã hé lộ những cuộc thảo luận nội bộ đầy nhạy cảm. Các hồ sơ cho thấy nhân viên Microsoft đã đặt ra những câu hỏi hóc búa về quy trình huấn luyện AI từ nhiều năm trước khi cuộc tranh luận công khai nổ ra, bao gồm cả việc liệu toàn bộ hoạt động này có cấu thành vụ trộm lao động lớn nhất trong lịch sử nhân loại hay không.

ƯU ĐÃI ĐỘC QUYỀN

Sử dụng mã TRYHARD33 khi thanh toán để nhận ưu đãi trước khi mã hết hạn.

Nhận ưu đãi 33% cho gói đăng ký GAMES+

Những gì tài liệu được công bố thực sự đề cập

Vụ kiện, được Times đệ trình vào cuối năm 2023, từ đó đã có thêm mười một nhà xuất bản khác tham gia. Thẩm phán Sidney Stein của Tòa án Quận phía Nam New York hiện đang xem xét các kiến nghị phán quyết tóm tắt, và các tài liệu đang được công bố như một phần của quy trình đó.

Bản ghi nhớ chứa ngôn từ mạnh mẽ nhất đến từ Brent Hecht, một giám đốc khoa học ứng dụng tại Microsoft, người cũng từng giữ vị trí tại Northwestern University. Trong một tài liệu nội bộ năm 2023, Hecht viết rằng các mô hình AI lớn "là một sản phẩm phá hủy chính chuỗi cung ứng của nó," và cảnh báo rằng công chúng cuối cùng sẽ coi việc thu thập dữ liệu hàng loạt từ công sức của họ là hành vi trộm cắp ở quy mô chưa từng có.

Microsoft đã nhanh chóng tách biệt mình khỏi những lời lẽ đó. Công ty cho biết Hecht được tuyển dụng cụ thể để "trình bày các quan điểm khác biệt và bất đối xứng" và không phải là người ra quyết định. Microsoft lập luận rằng các bản ghi nhớ của ông không đại diện cho quan điểm của công ty.

Tuy nhiên, vấn đề nằm ở chỗ: việc một người được trả lương để nêu lên những lo ngại đó, và những lo ngại đó được ghi lại bằng văn bản, chính là loại bằng chứng có trọng lượng tại tòa án.

Lời khai của Nadella và vấn đề tường phí (paywall)

Satya Nadella, CEO của Microsoft, đã làm chứng rằng "bất cứ thứ gì nằm sau tường phí (paywall) đều cần được cấp phép bởi bất kỳ ai muốn sử dụng nó." Ông còn đi xa hơn khi nói rằng nếu biết OpenAI đang huấn luyện trên nội dung có tường phí, ông đã thực hiện quyền theo hợp đồng của Microsoft để yêu cầu huấn luyện lại các mô hình. Một phát ngôn viên của công ty sau đó cho biết Nadella "đã nói về các nguyên tắc rộng lớn" về cách mọi người tìm kiếm và tiêu thụ thông tin, điều này được xem là một bước lùi khá đáng kể.

Khoảng cách giữa những gì Nadella nói dưới tuyên thệ và những gì phát ngôn viên của công ty làm rõ sau đó là điều đáng chú ý khi vụ kiện tiến triển.

Các cuộc trò chuyện nội bộ của OpenAI cũng thẳng thắn không kém

Các tài liệu cũng không để OpenAI đứng ngoài cuộc. Một nhân viên OpenAI đã nói với chủ tịch Greg Brockman về việc xây dựng một giải pháp thay thế để vượt qua tường phí của Times trong quá trình huấn luyện. Phản hồi của Brockman là: "ah nice" (tạm dịch: à hay đấy).

Nick Turley, người điều hành nhóm sản phẩm ChatGPT, đã viết vào tháng 6 năm 2023 rằng AI đặt ra một "mối đe dọa hiện hữu" đối với các nhà xuất bản. Đến tháng 2 năm 2024, ông viết rằng các sản phẩm AI "sẽ ngày càng thay thế nhiều hơn khi chúng trở nên tốt hơn." Một kỹ sư của OpenAI, viết vào tháng 2 năm 2023, lưu ý rằng "dù chúng ta hiển thị các liên kết nổi bật đến đâu, người dùng cũng sẽ không nhấp vào" các nguồn tin, điều này đi ngược lại trực tiếp với lập luận rằng chatbot giúp điều hướng lưu lượng truy cập trở lại cho các nhà xuất bản.

Điều mà hầu hết mọi người bỏ lỡ ở đây là đây không phải là các tài liệu bị rò rỉ từ người tố giác. Đây là những thông tin liên lạc nội bộ mà OpenAI và Microsoft đã tạo ra, lưu trữ và hiện đang bị yêu cầu cung cấp trong quá trình tố tụng. Các công ty này biết rõ những gì họ đang viết vào thời điểm đó.

Cảnh báo về "vòng lặp diệt vong" (doom loop)

Ngoài việc định khung là hành vi trộm cắp lao động, bản ghi nhớ năm 2023 của Hecht đã nêu lên một mối lo ngại riêng biệt mà từ đó đã trở thành một cuộc tranh luận sôi nổi trong giới nghiên cứu AI. Lập luận cho rằng việc huấn luyện trên nội dung do AI tạo ra sẽ tạo ra một vòng lặp phản hồi làm suy giảm chất lượng mô hình theo thời gian, khi đầu ra của thế hệ mô hình này trở thành dữ liệu huấn luyện cho thế hệ tiếp theo.

Đây không phải là một mối lo ngại bên lề. Các nhà nghiên cứu đã và đang nghiên cứu điều gì xảy ra với đầu ra của mô hình khi dữ liệu tổng hợp (synthetic data) bão hòa nhóm dữ liệu huấn luyện, và kết quả không mấy khả quan. Điểm mấu chốt ở đây là một người trong nội bộ Microsoft đã cảnh báo rủi ro này ngay tại thời điểm công ty đang công khai lạc quan về tiềm năng của AI.

Lập luận về sử dụng hợp lý (fair use) và ý kiến của các nhà xuất bản

Cả MicrosoftOpenAI đều lập luận rằng việc huấn luyện trên nội dung đã xuất bản cấu thành "sử dụng hợp lý" (fair use), biến đổi các bài báo thành một thứ gì đó mới thay vì thay thế cho bản gốc. Lập luận đó vẫn chưa được kiểm chứng tại tòa.

Steven Lieberman, đại diện cho New York Daily News và bảy nhà xuất bản nguyên đơn khác, đã tóm tắt cách hiểu của các nguyên đơn về các tài liệu được công bố một cách rõ ràng: "Thế giới có thể thấy những gì OpenAI và Microsoft đã nghĩ ngay từ đầu về tính công bằng trong hành vi của chính họ."

Một bản ghi nhớ năm 2020 từ Jack Clark, khi đó là giám đốc chính sách của OpenAI, đã cảnh báo rằng công ty đang "tạo ra các hệ thống thay thế cho sức lao động của những người định hình văn hóa xã hội" và sẽ "trở thành biểu tượng cho cách Thung lũng Silicon thiếu suy nghĩ bước vào các khía cạnh khác của cuộc sống và để lại một đống hỗn độn." Clark sau đó đã rời đi để đồng sáng lập Anthropic.

Times, với tư cách là nguyên đơn trong vụ kiện của chính mình, đã từ chối bình luận. OpenAI không phản hồi các yêu cầu bình luận.

Điều này có ý nghĩa gì đối với hệ sinh thái AI và trò chơi rộng lớn hơn

Vụ kiện này quan trọng vượt xa ngành xuất bản. Những câu hỏi tương tự về dữ liệu huấn luyện, sự đồng ý và thù lao đang được đặt ra trên khắp các lĩnh vực sáng tạo, bao gồm phát triển trò chơi, thiết kế mỹ thuật (concept art), lồng tiếng và viết kịch bản. Nếu tòa án cuối cùng phán quyết rằng việc quét dữ liệu AI hàng loạt không cấu thành "sử dụng hợp lý", thì những tác động đối với cách các công cụ AI được xây dựng và cấp phép sẽ lan rộng khắp mọi ngành công nghiệp sáng tạo.

Đối với các game thủ và nhà phát triển đang theo dõi các công cụ AI trở thành một phần tiêu chuẩn trong quy trình sản xuất, kết quả của vụ kiện này có thể định hình hình dáng của những công cụ đó và ai sẽ được trả tiền khi chúng được sử dụng. Bạn sẽ muốn theo dõi phán quyết tóm tắt của Thẩm phán Stein, điều này sẽ báo hiệu liệu vụ việc này sẽ ra tòa hay được giải quyết trước khi hồ sơ bằng chứng đầy đủ được kiểm chứng.

Để biết thêm thông tin về các câu chuyện trong ngành ảnh hưởng đến cách trò chơi được tạo ra, hãy xem hướng dẫn chơi game của chúng tôi và tiếp tục theo dõi trang này khi vụ kiện tiến triển qua các cấp tòa án.

Báo cáo

đã cập nhật

tháng 9 18 2026

đã đăng

tháng 9 18 2026

Quảng cáo

Tin tức liên quan