Một thực tế đáng thất vọng đối với các nhà sáng tạo ngày nay là tác phẩm bị đưa vào huấn luyện AI. Các công ty công nghệ phát triển AI tạo sinh như ChatGPT, Gemini, DeepSeek, Stable Diffusion và Midjourney cần các bộ dữ liệu khổng lồ để huấn luyện mô hình, và họ đã thu thập dữ liệu từ internet công cộng để thực hiện việc này.

Điều này đã đặt ra những câu hỏi quan trọng về sự đồng ý, ghi công và quyền kiểm soát đối với tác phẩm sáng tạo sau khi được chia sẻ trực tuyến.

Nếu đang tìm cách bảo vệ dữ liệu sáng tạo tốt hơn, hướng dẫn này sẽ phác thảo các bước thực tế có thể thực hiện để giảm thiểu việc tác phẩm bị sử dụng trong huấn luyện AI, trong khi vẫn tương tác với internet theo các điều khoản riêng.

Việc huấn luyện AI trên nội dung công cộng có thể gây rủi ro cho tác phẩm sáng tạo như thế nào

Các công cụ AI tạo sinh yêu cầu một lượng lớn dữ liệu để hoạt động, và phần lớn dữ liệu đó được lấy từ internet. OpenAI đã tuyên bố công khai(cửa sổ mới) rằng sẽ là “không thể” nếu muốn huấn luyện AI như ChatGPT mà không truy cập vào tài liệu có bản quyền trên mạng trực tuyến.

Các tác phẩm sáng tạo từ hồ sơ năng lực trực tuyến, nền tảng mạng xã hội và blog đang được sử dụng để huấn luyện các mô hình này mà không có sự đồng ý hoặc ghi công. Ví dụ, Meta đã thừa nhận(cửa sổ mới) đã thu thập các bài đăng, ảnh và bình luận được chia sẻ công khai trên Facebook và Instagram từ năm 2007 để huấn luyện các mô hình AI tạo sinh của mình. Điều đó có nghĩa là bất kỳ tác phẩm sáng tạo nào từng được chia sẻ công khai trên các nền tảng đó — như ảnh cưới, ảnh hồ sơ năng lực hoặc hình minh họa — đều có thể bị sử dụng để huấn luyện AI trừ khi đã đặt chế độ hiển thị thành riêng tư.

Các công ty AI đã lập luận trong các vụ kiện tụng(cửa sổ mới) đang diễn ra rằng việc huấn luyện trên dữ liệu internet được thu thập thuộc phạm vi “sử dụng hợp lý”. Đồng thời, họ coi các mô hình và bộ dữ liệu thu được là tài sản độc quyền. Điều khoản dịch vụ của OpenAI cấm “sử dụng Đầu ra để phát triển các mô hình cạnh tranh với OpenAI”, và công ty này đã cáo buộc DeepSeek sao chép “không thích hợp”(cửa sổ mới) các mô hình của mình — chính là các mô hình được huấn luyện trên dữ liệu internet công khai.

Tiêu chuẩn kép rõ ràng này giúp giải thích tại sao nhiều nhà sáng tạo cảm thấy tác phẩm của họ dễ bị tổn hại bởi việc huấn luyện AI mà không có sự đồng ý, tín dụng hoặc bồi thường. Điều này cũng đặt ra những câu hỏi rộng hơn về cách giải thích nội dung “có sẵn công khai”, đặc biệt là khi tác phẩm sáng tạo được chia sẻ trên các nền tảng có giấy phép giới hạn rõ ràng việc tái sử dụng trái phép hoặc khai thác thương mại. Kết quả là, many nghệ sĩ, nhà văn và nhiếp ảnh gia đang ngày càng phản đối việc thu thập dữ liệu AI.

Cách ngăn AI sử dụng tác phẩm nghệ thuật

Với việc các tòa án vẫn đưa ra quyết định theo từng trường hợp và chưa có tiêu chuẩn pháp lý rõ ràng, các nhà sáng tạo không thể chỉ dựa vào hệ thống pháp luật để bảo vệ tác phẩm. Trong thời gian chờ đợi, có những bước thực tế có thể thực hiện ngay để giảm thiểu việc tác phẩm bị sử dụng trong huấn luyện AI.

Tuy nhiên, không có chiến lược nào trong số này là hoàn hảo; các công cụ bảo vệ và các công ty AI luôn cố gắng vượt mặt nhau. Hiện tại, hãy coi chúng như những bộ phận riêng lẻ trong bộ giáp hoạt động tốt hơn khi kết hợp lại. Đây là những cách tốt nhất để có thêm quyền kiểm soát dữ liệu sáng tạo:

Ẩn giấu phong cách nghệ thuật

Các công cụ ẩn giấu như Glaze(cửa sổ mới) khiến các mô hình AI khó huấn luyện trên tác phẩm hơn bằng cách thực hiện những thay đổi nhỏ đối với các pixel gây nhầm lẫn cho mô hình AI. Hình ảnh vẫn hiển thị như mong muốn đối với con người, nhưng đối với trình thu thập dữ liệu AI, nó được ghi nhận là một phong cách khác hoặc bị bóp méo.

“Đầu độc” tác phẩm nghệ thuật

Bằng cách sử dụng các công cụ như Nightshade(cửa sổ mới), có thể làm cho tác phẩm nghệ thuật có tính độc đối với các trình thu thập dữ liệu AI. Một hình ảnh bị “đầu độc” chứa những thay đổi tinh vi, vô hình gây cản trở quá trình huấn luyện AI, khiến hệ thống hiểu sai những gì đang nhìn thấy, chẳng hạn như ô tô thay vị mèo, hoặc đám mây thay vì máy bay. Theo thời gian, nếu có đủ số lượng hình ảnh bị đầu độc được sử dụng để huấn luyện, những mối liên hệ sai lệch đó có thể hiển thị trong các phiên bản tương lai của mô hình.

Tuy nhiên, các biện pháp bảo vệ kỹ thuật như Glaze và Nightshade không phải là hoàn hảo, và nghiên cứu(cửa sổ mới) hiển thị chúng có thể bị suy yếu khi các hệ thống AI phát triển.

Từ chối tham gia huấn luyện AI

Nếu tác phẩm tồn tại trực tuyến, rất có thể nó đã bị thu thập vào một mô hình AI. Sử dụng các trang web như Have I Been Trained(cửa sổ mới)AI Watchdog(cửa sổ mới) của The Atlantic, có thể kiểm tra xem hình ảnh, bài viết hoặc tác phẩm sáng tạo khác có xuất hiện trong các bộ dữ liệu đã biết được sử dụng để huấn luyện mô hình AI hay không. Trang web đầu tiên cho phép gửi tác phẩm đến sổ đăng ký Do Not Train, nơi các công ty tham gia có thể xác định và loại trừ các hình ảnh đó khỏi các đợt huấn luyện trong tương lai. Tuy nhiên, các biện pháp này là tự nguyện, phụ thuộc vào mức độ sẵn lòng của từng công ty để tôn trọng chúng và không ảnh hưởng đến các mô hình đã được huấn luyện bằng tác phẩm trước đó.

Nếu sống ở EU, có thể sử dụng các luật bảo vệ dữ liệu như GDPR(cửa sổ mới) để mang lại lợi thế bằng cách yêu cầu các công ty loại trừ nội dung khỏi việc huấn luyện AI. Một số công ty có quy trình từ chối ẩn sâu trong cài đặt của các ứng dụng; ví dụ, đây là cách từ chối sử dụng dữ liệu Meta AI trên Facebook, Instagram và WhatsApp.

Khóa chặt cài đặt quyền riêng tư

Giảm thiểu các bài đăng công khai trên mạng xã hội và đảm bảo hồ sơ được thiết lập ở chế độ riêng tư. Càng ít nội dung có thể truy cập công khai, các hệ thống AI bên ngoài càng khó thu thập dữ liệu. Tuy nhiên, điều này có thể không đủ để bảo vệ khỏi chính nền tảng đó, vì nhiều công ty ngày càng tích hợp các tính năng AI — chẳng hạn như Meta sử dụng tất cả các tương tác Meta AI để đào tạo và quảng cáo — đặt ra câu hỏi về cách cả nội dung công khai và riêng tư có thể được sử dụng theo thời gian. Tốt nhất nên tránh sử dụng mạng xã hội làm lưu trữ chính hoặc danh mục hồ sơ năng lực.

Hãy có chủ đích khi chia sẻ công khai

Khi đăng bài công khai để tiếp cận đối tượng, hãy chia sẻ các phiên bản tác phẩm có kích thước nhỏ hơn, độ phân giải thấp hơn hoặc có đóng dấu mờ. Hãy lưu giữ các tệp chất lượng đầy đủ được lưu trữ trong các bản sao lưu ngoại tuyến hoặc các dịch vụ đám mây cam kết rõ ràng không sử dụng nội dung riêng tư để đào tạo AI.

Lưu trữ và chia sẻ tệp an toàn

Khi các công cụ AI ngày càng được tích hợp sâu rộng trên các nền tảng lớn — chẳng hạn như Google thêm Gemini ở mọi nơi bao gồm cả Google DriveGmail — mọi người ngày càng thận trọng hơn về cách lưu trữ và chia sẻ tác phẩm của mình.

Proton Drive cung cấp dịch vụ lưu trữ và chia sẻ đã mã hóa đầu cuối cho ảnh, video, album, tài liệu, bảng tính và các tệp khác. Proton không bao giờ thu thập, xử lý, chia sẻ dữ liệu với bên thứ ba hoặc sử dụng dữ liệu đó để đào tạo AI. Không giống như Big Tech, Proton được hỗ trợ hoàn toàn bởi cộng đồng người đăng ký trả phí thay vì quảng cáo hoặc sử dụng dữ liệu.

Có thể chia sẻ các liên kết được bảo vệ bằng mật khẩu, đặt ngày hết hạn, chỉ cấp quyền truy cập cho những người cụ thể qua email và thu hồi quyền truy cập bất kỳ lúc nào. Cũng có thể thu thập tệp một cách an toàn từ những người không có Tài khoản Proton.

Sử dụng AI riêng tư mà không mất quyền kiểm soát

Nếu muốn nhận được lợi ích từ AI mà không mất quyền kiểm soát tác phẩm, đồng thời không lo lắng rằng thay đổi chính sách trong tương lai có thể đột ngột biến các tệp thành dữ liệu đào tạo, hãy sử dụng trợ lý AI riêng tư(cửa sổ mới). Lumo không bao giờ đào tạo dựa trên các tệp hoặc hội thoại và trợ lý này hoạt động dựa trên mã nguồn mở, nghĩa là bất kỳ ai cũng có thể xác minh các tuyên bố.

Lumo tích hợp với Proton Drive, cho phép làm việc an toàn với các tệp và tạo hình ảnh mà không cần đóng góp vào hệ sinh thái thu thập dữ liệu AI mà rất nhiều cá nhân và tổ chức đang tích cực phản đối.

Tác phẩm nghệ thuật là dữ liệu nhạy cảm

Ngăn chặn hành vi trộm cắp tác phẩm nghệ thuật bằng AI không có nghĩa là từ chối hoàn toàn AI. Nhưng điều đó có nghĩa là phải thừa nhận rằng tác phẩm sáng tạo là dữ liệu nhạy cảm, cho dù đó là tranh minh họa, tiểu thuyết hay bài hát. Người sáng tạo xứng đáng có quyền tự quyết và được đối xử công bằng, bao gồm cả khả năng quyết định cách thức và liệu tác phẩm có được sử dụng hay không.

Không có một chiến lược đơn lẻ nào có thể ngăn chặn hoàn toàn các hệ thống AI hấp thụ nội dung công khai — và trong một số trường hợp là nội dung riêng tư bị tiết lộ gián tiếp — vào quá trình đào tạo của chúng. Và các công ty AI sẽ khiến mọi người tin rằng không có cách nào để xây dựng các công cụ AI mà không sử dụng dữ liệu cá nhân. Proton không đồng ý(cửa sổ mới).

Cho đến khi các cơ quan quản lý và tòa án đưa ra hướng dẫn rõ ràng hơn, cách tiếp cận hiệu quả nhất là chủ động khi tương tác với internet và chọn các nền tảng tôn trọng rõ ràng quyền riêng tư cũng như quyền sáng tạo.