Một quan niệm sai lầm phổ biến là nếu không sử dụng mô hình ngôn ngữ lớn (LLM) như ChatGPT để trò chuyện, Midjourney để tạo hình ảnh hoặc Sora để tạo video, thì sẽ an toàn trước trí tuệ nhân tạo (AI). Dù có sử dụng hay không, AI đã tác động đến cuộc sống.
Ví dụ: khi chụp ảnh trên Android, Google Photos sẽ tự động quét và gán nhãn cho từng người trong thư viện ảnh bằng nhận dạng khuôn mặt. Việc đăng lên mạng xã hội mà không thay đổi cài đặt mặc định sẽ tạo ra các bài đăng công khai có thể bị thu thập vào các tập dữ liệu khổng lồ dùng để huấn luyện LLM. Ngay cả các quảng cáo được cá nhân hóa trên các trang web hoặc trong ứng dụng cũng được cung cấp bởi AI được huấn luyện dựa trên tùy chọn duyệt web và mua sắm.
Sự tiện lợi đó phải đánh đổi bằng quyền riêng tư và có thể ảnh hưởng sâu sắc đến cuộc sống. Hai mươi bức ảnh được lấy từ bảng tin mạng xã hội của con trẻ là đủ để tạo ra một video deepfake dài 30 giây có thể được sử dụng để tống tiền, bắt nạt hoặc đánh cắp danh tính.
Dưới đây là những gì bị đe dọa khi AI có quyền truy cập vào dữ liệu cá nhân và những gì có thể làm để bảo vệ quyền riêng tư trực tuyến.
- AI đang đe dọa quyền riêng tư như thế nào?
- Dữ liệu cá nhân có thể bị thu thập
- Có thể bị nhận diện lại
- Dữ liệu có thể bị chia sẻ với bên thứ ba
- Các yêu cầu xóa dữ liệu có thể không hiệu quả
- Người khác có thể xem các cuộc trò chuyện riêng tư
- Có thể bị đối xử bất công
- Tính năng nhắm mục tiêu quảng cáo đang ngày càng sắc bén hơn
- Lưu trữ đám mây có thể để lộ dữ liệu
- AI có thể mắc sai lầm
- Bất kỳ ai cũng có thể tạo deepfake
- Cách giữ dữ liệu riêng tư trước các hệ thống AI
AI đang đe dọa quyền riêng tư như thế nào?
AI có thể hủy hoại quyền riêng tư bằng cách thu thập quá nhiều, suy luận quá nhiều, chia sẻ quá nhiều.
Dữ liệu cá nhân có thể bị thu thập
Các hệ thống AI trở nên chính xác hơn bằng cách huấn luyện trên lượng dữ liệu khổng lồ, thường được thu thập từ các nguồn công khai, chẳng hạn như bài đăng Facebook(cửa sổ mới), ảnh Flickr(cửa sổ mới), hoặc các chuỗi Reddit(cửa sổ mới). Các bài đăng thông thường trên mạng xã hội, ảnh gia đình và chi tiết hồ sơ — thường chứa thông tin nhạy cảm và ban đầu được chia sẻ vì lý do cá nhân hoặc xã hội — đã được đưa vào các tập dữ liệu dùng để huấn luyện các LLM trị giá hàng tỷ đô la và hệ thống nhận dạng khuôn mặt. Điều này xảy ra vì Big Tech coi nội dung trực tuyến là có sẵn miễn phí cho AI sử dụng, không cần sự đồng ý rõ ràng hoặc bận tâm đến sở hữu trí tuệ.
Có thể bị nhận diện lại
Các công ty công nghệ tuyên bố dữ liệu cá nhân không thể bị truy ngược lại nguồn gốc sau khi đã được xóa danh tính hoặc ẩn danh hóa giả, nghĩa là các thông tin định danh rõ ràng như tên hoặc số điện thoại đã bị loại bỏ. Tuy nhiên, lớp bảo vệ này rất mong manh, vì các tập dữ liệu ẩn danh vẫn có thể bị nhận diện lại bằng cách đối chiếu chéo với các nguồn dữ liệu khác, chẳng hạn như hồ sơ mạng xã hội hoặc dấu vết định vị.
Ví dụ: người dùng Netflix đã bị nhận diện lại(cửa sổ mới) bằng cách so sánh các đánh giá phim ẩn danh với thông tin trên IMDb. Một nghiên cứu(cửa sổ mới) hiển thị rằng hầu hết mọi người Mỹ đều có thể bị nhận diện riêng biệt trong bất kỳ tập dữ liệu nào chỉ với 15 đặc điểm nhân khẩu học. Cộng thêm khả năng khớp mẫu của AI, việc nhận diện lại đã trở nên nhanh chóng, dễ dàng hơn và bất kỳ ai cũng có thể thực hiện.
Dữ liệu có thể bị chia sẻ với bên thứ ba
Khi sử dụng hệ thống AI, dữ liệu không phải lúc nào cũng nằm lại tại công ty đã đăng ký. Dữ liệu có thể bị chia sẻ với các đối tác hoặc bên xử lý thứ ba — một số bên có thể chưa bao giờ được nghe tới — những bên có thể xử lý dữ liệu theo các điều khoản và tiêu chuẩn bảo mật riêng của họ.
Tại thời điểm đó, quyền riêng tư trở thành một bài toán về lòng tin. Người dùng không còn chỉ dựa vào công ty quen thuộc để bảo vệ thông tin của mình, mà là vào toàn bộ chuỗi các tác nhân bên ngoài chưa biết tới, mỗi tác nhân đều có cơ sở hạ tầng, chính sách và lỗ hổng riêng. Mỗi bàn tay chạm vào dữ liệu sẽ mở rộng bề mặt tấn công, và trách nhiệm giải trình bị mờ nhạt.
Ví dụ, một vụ vi phạm liên quan đến đối tác của OpenAI đã dẫn đến việc lộ dữ liệu người dùng API, hiển thị cách truy cập của bên thứ ba có thể trở thành liên kết yếu nhất trong hệ thống.
Yêu cầu xóa dữ liệu có thể không hoạt động
Một khi dữ liệu đào tạo một mô hình AI, việc lấy lại là gần như không thể vì nó định hình hành vi tổng thể của mô hình. Giải pháp máy quên — các kỹ thuật giúp mô hình quên đi — vẫn đang ở giai đoạn đầu, vì vậy lựa chọn duy nhất hiện nay là đào tạo lại mô hình. Và ngay cả khi một công ty tuyên bố đã thực hiện yêu cầu xóa dữ liệu, thực tế vẫn không có cách nào để xác nhận(cửa sổ mới).
Người khác có thể xem các cuộc trò chuyện riêng tư
Các mô hình ngôn ngữ lớn như ChatGPT(cửa sổ mới), Meta AI(cửa sổ mới) và Grok(cửa sổ mới) đã làm lộ các cuộc hội thoại riêng tư thông qua tính năng chia sẻ, với các cuộc trò chuyện bị lập chỉ mục bởi các công cụ tìm kiếm và hiển thị công khai. Các nền tảng đã không đủ minh bạch về rủi ro này, khiến người dùng không biết rằng những gì tưởng chừng như là trao đổi riêng tư lại có thể hiển thị với bất kỳ ai trên internet.
Có thể bị đối xử bất công
Nếu dữ liệu được hệ thống AI sử dụng để học hỏi các mẫu chứa định kiến ẩn — chẳng hạn như từ sự bất bình đẳng trong lịch sử hoặc các tập dữ liệu không đầy đủ — AI có thể củng cố hoặc khuếch đại các mẫu đó. Rủi ro cao hơn đối với các hệ thống AI không riêng tư của Big Tech, vốn là mã nguồn đóng và hoạt động như những chiếc hộp đen không thể đánh giá độc lập. Các hệ thống này có thể sử dụng các thuộc tính nhạy cảm như chủng tộc, giới tính hoặc mã vùng để đưa ra các quyết định tự động trong hoạt động cảnh sát dự đoán(cửa sổ mới), tuyển dụng(cửa sổ mới), chăm sóc sức khỏe(cửa sổ mới) hoặc chấm điểm tín dụng(cửa sổ mới).
Nhắm mục tiêu quảng cáo đang trở nên sắc bén hơn
Trong khi AI không riêng tư giúp quảng cáo thông minh hơn bằng cách kích hoạt tính năng siêu nhắm mục tiêu, nó thường xâm phạm quyền riêng tư của cả gia đình. Ví dụ, Publicis, một nhà môi giới dữ liệu và là công ty quảng cáo lớn nhất thế giới, tuyên bố lập hồ sơ của 2,3 tỷ người và theo dõi các chi tiết như tùy chọn gia đình và thu nhập(cửa sổ mới) để quyết định xem có nên nhắm mục tiêu họ bằng các sản phẩm giá rẻ hay cao cấp hay không.
Với việc chatbot AI thay thế tìm kiếm truyền thống, quảng cáo đang theo chúng ta vào không gian mới này. Ví dụ, Perplexity đang nhúng quảng cáo vào các câu trả lời do AI tạo ra(cửa sổ mới) và đã đưa ra mức giá 34,5 tỷ USD để mua Google Chrome — một động thái nhằm giành quyền truy cập vào hơn 3 tỷ người dùng của trình duyệt và dữ liệu hành vi riêng tư đi kèm.
Lưu trữ đám mây có thể để lộ dữ liệu
Các nhà cung cấp lưu trữ đám mây không có mã hóa đầu cuối (E2EE) có thể truy cập ảnh, tài liệu và các tệp nhạy cảm được tải lên. Họ cũng có thể sử dụng dữ liệu đó để cung cấp năng lượng cho các công cụ AI, tạo thông tin chi tiết hoặc hiển thị quảng cáo được cá nhân hóa.
Ví dụ, Google Drive vẫn giữ quyền truy cập vào dữ liệu và sử dụng dữ liệu đó cho các tính năng AI như kiểm tra chính tả và tự động hoàn tất trong Google Docs. Nếu Gemini, trợ lý AI của Google, vẫn được tích hợp chặt chẽ với Google Workspace, các câu hỏi về các tệp trong Drive cũng có thể được đưa vào đào tạo AI.
Tương tự, Microsoft đã thông báo rằng Word, Excel và PowerPoint sẽ sớm tự động lưu vào OneDrive theo mặc định, một dịch vụ không có E2EE khác, nơi việc sử dụng dữ liệu trong tương lai cho quảng cáo hoặc đào tạo AI vẫn chưa chắc chắn.
AI có thể mắc sai lầm
Các hệ thống tự động có thể quét các thông tin liên lạc riêng tư và gắn cờ chúng là đáng ngờ. Đạo luật Kiểm soát trò chuyện do EU đề xuất sẽ yêu cầu các dịch vụ nhắn tin như WhatsApp và Signal sử dụng AI để quét mọi thư riêng tư và ảnh nhằm phát hiện tài liệu lạm dụng tình dục trẻ em (CSAM).
Nhưng điều này có nghĩa là giám sát các cuộc hội thoại của mọi người, không chỉ riêng của những kẻ tình nghi là tội phạm. Và lịch sử hiển thị rằng AI có thể dễ dàng mắc sai lầm như thế nào. Ví dụ, tài khoản Google của một người cha đã bị chấm dứt(cửa sổ mới) và bị báo cáo với chính quyền sau khi gửi ảnh của con mình cho bác sĩ. Những gì đáng lẽ phải giữ riêng giữa bệnh nhân và bác sĩ, hoặc giữa các thành viên trong gia đình, đột nhiên có thể bị lộ với các công ty công nghệ và cơ quan thực thi pháp luật.
Ai cũng có thể tạo deepfake
AI có thể được sử dụng để tạo deepfake — hình ảnh, video hoặc âm thanh giả mạo có độ chân thực cao. Ví dụ: ai đó có thể lấy ảnh trên mạng xã hội và tạo video mô tả những lời nói hoặc hành động chưa từng thực hiện.
Kẻ xấu khai thác deepfake để đánh cắp danh tính, lừa đảo, tống tiền hoặc làm tổn hại uy tín — và các rủi ro này còn mở rộng đến cả trẻ em. Vào năm 2019, tội phạm đã sử dụng âm thanh deepfake để giả giọng một CEO(cửa sổ mới) và lừa một nhân viên chuyển 220.000 euro. Rủi ro cũng mở rộng đến cả trẻ em. Trong một vụ việc, kẻ săn mồi đã tạo hình ảnh deepfake của một trẻ 14 tuổi(cửa sổ mới) để tống tiền bằng cách đe dọa sẽ chia sẻ hình ảnh đó.
Cách giữ dữ liệu riêng tư khỏi các hệ thống AI
Có nhiều mối lo ngại về quyền riêng tư đối với các hệ thống AI, đặc biệt là các mô hình mã nguồn đóng, không riêng tư do các ông lớn công nghệ điều hành. Và mặc dù không thể ngăn chặn hoàn toàn các hệ thống này thu thập hoặc lạm dụng dữ liệu một khi dữ liệu đã xuất hiện trên internet, người dùng vẫn có thể giảm thiểu dấu chân số của mình, yêu cầu trách nhiệm giải trình và chọn AI ưu tiên quyền riêng tư không khai thác dữ liệu của mình. Dưới đây là những gì có thể làm:
- Trên mạng xã hội, hãy đặt hồ sơ và bài đăng ở chế độ riêng tư, xóa các bản tải lên cũ, loại bỏ dữ liệu EXIF khỏi ảnh trước khi chia sẻ và tránh chia sẻ các chi tiết có thể nhận dạng — như địa chỉ, tên đầy đủ của trẻ em hoặc trường học chúng đang theo học. Tìm hiểu thêm về cách quản lý internet cho gia đình.
- Kiểm tra cài đặt quyền riêng tư của các ứng dụng. Ví dụ: Meta AI có thể đang quét ảnh trong cuộn camera và video trên ứng dụng Facebook cho Android và iOS.
- Bảo vệ chống lại deepfake bằng cách làm mờ hoặc che khuôn mặt của gia đình trước khi đăng ảnh trực tuyến.
- Tạo mặt nạ cho dấu chân kỹ thuật số bằng cách sử dụng mạng riêng ảo (VPN)(cửa sổ mới) để ẩn địa chỉ IP, và sử dụng biệt danh để bảo vệ địa chỉ email khi đăng thông tin nhạy cảm không muốn bị truy nguyên về bản thân.
- Sử dụng các dịch vụ ưu tiên quyền riêng tư không kiếm tiền từ dữ liệu, chẳng hạn như Signal để nhắn tin bảo mật và Brave hoặc DuckDuckGo để duyệt web riêng tư.
- Để lưu trữ bảo mật các tệp nhạy cảm nhất, bao gồm ảnh riêng tư và tài liệu mật, hãy sử dụng Proton Drive để lưu trữ đám mây đã mã hóa đầu cuối. Không giống như các nền tảng có thể để lộ nội dung được cho là riêng tư, Drive không quét, lập chỉ mục hoặc sử dụng dữ liệu để huấn luyện AI — và không ai khác có thể xem được dữ liệu đó, ngay cả khi chọn chia sẻ. Việc giữ cho ảnh thực sự riêng tư cũng có nghĩa là chúng sẽ không xuất hiện trực tuyến, nơi chúng có thể bị lạm dụng để tạo deepfake.
- Từ chối tham gia huấn luyện AI bất cứ khi nào có thể, chẳng hạn như trên Gemini, ChatGPT(cửa sổ mới), Claude(cửa sổ mới) hoặc Meta AI. Các chính sách có thể thay đổi chỉ sau một đêm với rất ít cảnh báo, vì vậy nếu muốn có cả lợi ích của AI lẫn quyền riêng tư, hãy chuyển sang Lumo — trợ lý AI ưu tiên quyền riêng tư(cửa sổ mới) không giữ nhật ký hay huấn luyện trên dữ liệu.
Các quy định chặt chẽ hơn về quyền riêng tư của AI, chẳng hạn như Đạo luật AI của EU(cửa sổ mới), sẽ đóng vai trò quan trọng trong việc trả lại quyền lực cho người dùng internet. Cho đến lúc đó, cách phòng vệ tốt nhất là lưu ý đến những gì chia sẻ trực tuyến, yêu cầu trách nhiệm giải trình từ các công ty xây dựng các hệ thống này và lựa chọn các công cụ AI minh bạch(cửa sổ mới) tôn trọng quyền riêng tư ngay từ đầu.






