Khi các công ty cho biết dữ liệu cá nhân đã được phi danh tính hóa, điều đó nghe có vẻ như danh tính trực tuyến đã bị xóa bỏ vĩnh viễn. Thông tin trở thành nhiễu trong một tập dữ liệu, vì vậy có thể mất cảnh giác. Thật ra, không hoàn toàn như vậy.

Dữ liệu phi danh tính hóa là dữ liệu đã được xóa các thông tin định danh cá nhân rõ ràng nhất, như tên hoặc địa chỉ nhà. Nhưng trong một thế giới đầy các cơ sở dữ liệu kết nối với nhau, chỉ cần một vài chi tiết tưởng chừng như không liên quan để theo dõi một ai đó.

Nghiên cứu(cửa sổ mới) hiển thị rằng chỉ cần 15 điểm dữ liệu để xác định danh tính của 99,98% số người trong một tập dữ liệu hàng triệu người. Và với AI kết nối các mảnh ghép trong hoạt động trực tuyến, khoảng cách giữa ” ẩn danh” và “đã xác định” đang dần thu hẹp.

Hãy cùng tìm hiểu xem phi danh tính hóa dữ liệu thực sự có nghĩa là gì và có thể làm gì để bảo vệ tốt hơn quyền riêng tư.

Phi danh tính hóa dữ liệu là gì?

Phi danh tính hóa dữ liệu là quá trình không thể đảo ngược nhằm xóa mọi thông tin có thể định danh cá nhân khỏi các điểm dữ liệu, chẳng hạn như tên, địa chỉ email, số điện thoại liên hệ hoặc ngày sinh. Mục tiêu là cắt đứt liên kết giữa bản ghi và một người càng nhiều càng tốt.

Tuy nhiên, sau khi phi danh tính hóa, dữ liệu vẫn bao gồm các manh mối gián tiếp, chẳng hạn như vị trí chung, thói quen duyệt web và nhóm tuổi. Đứng riêng lẻ, các chi tiết này khá vô hại, nhưng khi kết hợp lại, chúng tạo thành một mô hình trỏ đến một người.

A diagram explaining how anonymization works

Một số loại dữ liệu, chẳng hạn như sinh trắc học, đặc biệt khó (hoặc thậm chí không thể) phi danh tính hóa thực sự. Có thể tạo tên người dùng an toàn nhưng không thể thay đổi khuôn mặt, dấu vân tay hoặc mô hình mống mắt của một người.

Khi dữ liệu được phi danh tính hóa thực sự, dữ liệu đó không còn được coi là thông tin cá nhân theo luật về quyền riêng tư như GDPR. Điều đó có nghĩa là các công ty có thể sử dụng dữ liệu đó mà không cần sự đồng ý và các yêu cầu bảo vệ áp dụng cho dữ liệu cá nhân.

Nhưng Điểm 26 của GDPR(cửa sổ mới) đặt ra tiêu chuẩn cao: dữ liệu không còn được xác định một người, ngay cả khi xem xét thông tin và phương pháp khác có thể được sử dụng một cách hợp lý để tái xác định danh tính của họ. Do đó, việc xóa tên hoặc địa chỉ email là không đủ nếu dữ liệu còn lại vẫn trỏ ngược về một ai đó.

Phi danh tính hóa so với giả danh hóa

Trong khi quá trình phi danh tính hóa xóa vĩnh viễn thông tin có thể định danh để đảm bảo không thể truy ngược lại một cá nhân, thì quá trình giả danh hóa thay thế dữ liệu đó bằng một nhãn, mã thông báo hoặc mã. Danh tính ban đầu được lưu trữ riêng biệt trong một khóa bảo mật hoặc bảng tra cứu, nhưng với quyền truy cập phù hợp, nhãn đó có thể được liên kết ngược lại với một người thực.

Một ví dụ về giả danh hóa là nghiên cứu y học, nơi tên bệnh nhân được thay thế bằng các mã. Các nhà nghiên cứu vẫn có thể theo dõi dữ liệu, nhưng chỉ những nhân sự được ủy quyền có khóa mới có thể kết nối lại dữ liệu đó với cá nhân.

Sự khác biệt này đơn giản nhưng quan trọng. Giả danh hóa được coi là dữ liệu cá nhân theo các quy định như GDPR vì nó vẫn có thể được liên kết ngược lại với một ai đó. Ngược lại, dữ liệu phi danh tính hóa chỉ nằm ngoài các nghĩa vụ đó khi việc tái xác định danh tính không còn khả thi một cách hợp lý.

Các kỹ thuật phi danh tính hóa dữ liệu phổ biến

Các công ty sử dụng các phương pháp phi danh tính hóa khác nhau tùy thuộc vào cách họ dự định sử dụng dữ liệu. Dưới đây là một số phương pháp phổ biến:

Ẩn dữ liệu thay thế thông tin bằng dữ liệu giả, chẳng hạn như đổi một số điện thoại lấy một số giả định.

Khái quát hóa làm cho dữ liệu bớt cụ thể hơn, như sử dụng các nhóm tuổi thay vì độ tuổi chính xác.

Tráo đổi dữ liệu xáo trộn thông tin giữa các bản ghi để chúng không còn khớp với người ban đầu.

Làm nhiễu dữ liệu làm mờ các chi tiết cá nhân trong khi vẫn bảo toàn xu hướng dữ liệu, chẳng hạn như thay đổi dữ liệu bằng cách làm tròn số.

Dữ liệu tổng hợp dựa trên dữ liệu nhân tạo mô phỏng các mô hình của tập dữ liệu ban đầu mà không sử dụng trực tiếp các bản ghi thực.

Các kỹ thuật này có thể giảm thiểu rủi ro về quyền riêng tư, nhưng hiệu quả của chúng phụ thuộc hoàn toàn vào mức độ chúng được áp dụng tốt như thế nào. Thậm chí sau đó, chúng có thể không xóa hết mọi manh mối có thể xác định một ai đó.

Cách các công ty sử dụng dữ liệu phi danh tính hóa

Dữ liệu phi danh tính hóa rất có giá trị vì các công ty có thể sử dụng hợp pháp theo bất kỳ cách nào họ muốn mà không cần sự đồng ý. Các mục đích sử dụng phổ biến bao gồm:

Phân tích và phát triển: Các công ty nghiên cứu hành vi của người dùng để cải thiện sản phẩm, đo lường xu hướng và định hướng các quyết định kinh doanh.

Quảng cáo: Mô hình duyệt web và mua hàng có thể được sử dụng để xây dựng các phân khúc đối tượng cho quảng cáo nhắm mục tiêu, ngay cả khi không đính kèm tên.

Nhà môi giới dữ liệu: Một số dữ liệu được tổng hợp, đóng gói và bán lại bởi các nhà môi giới dữ liệu. Các công ty này kết hợp thông tin từ ứng dụng, trang web, hồ sơ công khai, dữ liệu tín dụng và nhiều nguồn khác để xây dựng các hồ sơ chi tiết và bán cho bất kỳ ai muốn mua, với rất ít sự giám sát của pháp luật.

Huấn luyện mô hình AI: Các tập dữ liệu lớn thường được sử dụng để huấn luyện các hệ thống AI, bao gồm dữ liệu được lấy từ hoạt động của người dùng, các tập dữ liệu đã mua và các nguồn công khai hoặc được thu thập.

Nghiên cứu y tế: Ở một số quốc gia(cửa sổ mới), dữ liệu y tế phi danh tính hóa có thể được bán cho các công ty dược phẩm hoặc chia sẻ với các nhà nghiên cứu.

Dữ liệu phi danh tính hóa có thể được sử dụng cho mục đích tốt, chẳng hạn như cải thiện dịch vụ hoặc hỗ trợ nghiên cứu. Vấn đề là nó tạo ra một động lực thương mại mạnh mẽ để các nhà môi giới dữ liệu và nhà quảng cáo thu thập, kết hợp, chia sẻ, đóng gói lại và bán thông tin về mọi người, thường theo những cách không hiểu đầy đủ hoặc không đồng ý một cách có ý nghĩa. Đối với những người sau đó quyết định muốn rút lui, việc xóa dữ liệu không hề đơn giản.

Cơ quan quản lý quyền riêng tư của California đã tạo ra hệ thống DROP(cửa sổ mới) vì việc xóa dữ liệu từ hàng trăm nhà môi giới dữ liệu từ trước đến nay vốn rất khó khăn để các cá nhân tự quản lý. Điều này còn khó khăn hơn nhiều đối với dữ liệu huấn luyện AI, bởi vì một khi dữ liệu đã ảnh hưởng đến một mô hình đã được huấn luyện, việc xóa dữ liệu đó có thể yêu cầu các kỹ thuật hủy học máy(cửa sổ mới) mà các công ty AI không hề hứng thú(cửa sổ mới).

Tái xác định danh tính dữ liệu, hoặc tại sao dữ liệu phi danh tính hóa không thực sự ẩn danh

Nếu ai đó nói rằng họ đang tìm một người đàn ông ngoài 30 tuổi, lái một chiếc xe màu trắng và sống trong khu lân cận, bạn có thể đã biết rõ họ đang muốn nói đến ai. Không có chi tiết nào trong số đó có thể xác định riêng biệt người đó, nhưng khi kết hợp lại, chúng giúp thu hẹp các khả năng bằng cách loại trừ tất cả những người khác. Dữ liệu phi danh tính hóa cũng hoạt động theo cách tương tự: Ngay cả khi tên và chi tiết liên hệ bị xóa, thông tin còn lại vẫn có thể tiết lộ danh tính khi có đủ các chi tiết được kết hợp.

Khi các mô hình này được đối chiếu với các nguồn khác, chẳng hạn như mạng xã hội hoặc hồ sơ công khai, việc kết nối dữ liệu được cho là ẩn danh với một người trở nên khả thi. Điều này được gọi là tái xác định danh tính, và nó thường dễ dàng hơn mong đợi.

A diagram explaining how reidentification works

Nhà nghiên cứu Latanya Sweeney đã mua một tập dữ liệu bệnh viện(cửa sổ mới) với giá $50 chứa các thông tin định danh gián tiếp, chẳng hạn như nhân khẩu học, chẩn đoán và chi tiết thanh toán. Các chi tiết tiết lộ danh tính như tên không được bao gồm. Bằng cách đối chiếu dữ liệu này với các tin tức địa phương về các ca nhập viện, bà đã có thể khớp 43% số bệnh nhân với hồ sơ của họ, bao gồm cả lịch sử y tế đầy đủ của một bệnh nhân gặp tai nạn xe máy được báo cáo.

AI đang giúp việc hủy ẩn danh hóa diễn ra nhanh hơn và rẻ hơn

Nếu biện pháp bảo vệ duy nhất chống lại việc tái xác định danh tính từ dữ liệu ẩn danh là thời gian, sự kiên nhẫn và đối chiếu thủ công, thì biện pháp bảo vệ ngẫu nhiên đó đang dần bị xói mòn bởi AI.

Nghiên cứu hiển thị rằng các mô hình ngôn ngữ lớn (LLM) có thể phân tích bài đăng của ai đó trên các nền tảng, đối chiếu thông tin công khai và xác định những người dùng ẩn danh với độ chính xác đáng kinh ngạc. Trong một nghiên cứu về hủy ẩn danh hóa trên diện rộng(cửa sổ mới), các phương pháp dựa trên LLM đã xác định được tới 68% số người, và khi họ thực hiện đối khớp, họ đã đúng 90% số lần.

Sweeney chỉ phải trả 50 USD cho một tập dữ liệu gồm hàng trăm nghìn bản ghi. Ngày nay, các LLM có thể hủy ẩn danh các hồ sơ với chi phí chỉ 1-4 USD mỗi hồ sơ và thực hiện công việc này một cách tự động. Chúng cũng không cần các tập dữ liệu sạch, có cấu trúc và có thể phát hiện các mô hình trong các bài đăng và bình luận thông thường.

Như một trong những nhà nghiên cứu đã phát biểu:

“Hãy tự hỏi: Liệu một nhóm điều tra viên thông minh có thể tìm ra bạn là ai từ các bài đăng của bạn không? Nếu có, các tác nhân LLM có thể cũng làm được điều tương tự, và chi phí để làm việc đó chỉ ngày càng giảm xuống.”

Bảo vệ quyền riêng tư bằng cách thu nhỏ và mã hóa dữ liệu

Phi danh tính hóa dữ liệu là không đủ, vì việc tái xác định danh tính có thể xảy ra khi các mảnh ghép được kết nối. Cách tốt nhất để tự bảo vệ là thu nhỏ dấu chân kỹ thuật số, khiến bản thân khó bị tái xác định danh tính hơn.

Không nhất thiết phải hoàn toàn biến mất, nhưng nên cân nhắc kỹ hơn về những gì chia sẻ và chia sẻ như thế nào. Dưới đây là một số mẹo thực tế:

Phân chia danh tính để bảo vệ chống lại việc đối chiếu chéo

Khi sử dụng cùng một email và tên người dùng trên tất cả các nền tảng, các chi tiết cá nhân sẽ rất dễ bị liên kết với nhau. Việc tạo các tên người dùng khác nhau cho các tài khoản khác nhau rất đơn giản, nhưng việc sử dụng các địa chỉ email duy nhất cho mọi thứ có thể là một cơn ác mộng trừ khi sử dụng các biệt danh email.

Các biệt danh tạo ra các địa chỉ riêng biệt để chuyển tiếp thư đến hộp thư đến chính mà không để lộ địa chỉ email và danh tính thực. Nếu sử dụng một biệt danh email duy nhất cho mỗi dịch vụ, có thể biết được nguồn rò rỉ hoặc mua bán thông tin đến từ đâu.

Ví dụ: nếu tạo một biệt danh chỉ dành cho Công ty A và sau đó nhận được email gửi đến biệt danh đó từ Công ty B, bạn biết Công ty A đã chia sẻ, bán, rò rỉ hoặc mất quyền kiểm soát địa chỉ email. Sau đó, có thể vô hiệu hóa biệt danh đó mà không ảnh hưởng đến hộp thư đến chính hoặc các biệt danh khác.

Hãy tạo sự bất nhất để bảo vệ chống lại các mô hình có thể định danh

Các chi tiết càng đồng nhất trên các nền tảng thì việc xây dựng một hồ sơ duy nhất xung quanh bạn càng dễ dàng hơn. Nếu có thể, hãy tránh cung cấp nhiều thông tin hơn mức cần thiết.

Chẳng hạn, sử dụng vị trí chung thay vì thành phố chính xác, làm tròn tuổi và bỏ qua các trường tùy chọn. Ngoài ra, hãy cân nhắc tạo các biến thể nhỏ trong phong cách viết, chẳng hạn như các cụm từ lặp lại, dấu câu hoặc các lỗi chính tả phổ biến, để hạn chế việc nhận dạng tự động.

Hạn chế dấu chân kỹ thuật số để bảo vệ chống lại sự phân tích của AI

LLM có thể nhận dạng mọi người bằng cách tìm kiếm các mô hình trong các bài đăng và bài viết. Nội dung công khai gắn liền với danh tính càng ít thì càng có ít tài liệu để khai thác. Hãy cân nhắc xem bạn tiết lộ bao nhiêu chi tiết cá nhân khi đăng bài — không chỉ các sự thật, mà cả thói quen, ý kiến và các chủ đề lặp đi lặp lại khiến bạn nổi bật. Hãy chắc chắn từ chối tham gia huấn luyện AI trên càng nhiều nền tảng càng tốt.

Sử dụng các dịch vụ đã mã hóa đầu cuối để bảo vệ chống lại việc thu thập dữ liệu

Mã hóa không chỉ bảo vệ dữ liệu khỏi tin tặc mà còn giới hạn những gì có thể đọc ngay từ đầu. Một nhà cung cấp email không thể đọc thư thì không thể quét thư để quảng cáo, sử dụng thư để huấn luyện AI hoặc chia sẻ thông tin chi tiết với các nhà môi giới.

Sử dụng email đã mã hóa đầu cuối cho các cuộc giao tiếp riêng tư, lưu trữ đám mây an toàn để lưu trữ và chia sẻ tệp một cách an toàn, cùng một VPN(cửa sổ mới) không lưu nhật ký để mã hóa hoạt động duyệt web — tất cả đều giúp giảm lượng dữ liệu bị rò rỉ một cách ngoài ý muốn.

Từ chối thu thập dữ liệu để bảo vệ chống lại các nhà môi giới

Có thể xóa thông tin cá nhân khỏi internet, ngay cả từ các nhà môi giới dữ liệu, nhưng việc này đòi hỏi sự kiên trì. Việc này sẽ không ngăn chặn hoạt động thu thập dữ liệu trong tương lai, nhưng có thể mang lại một khởi đầu mới. Về sau, việc thu nhỏ dấu chân kỹ thuật số và mã hóa dữ liệu bất cứ khi nào có thể sẽ giúp hạn chế những gì bị thu thập.

A diagram explaining how to make yourself more anonymous

Phi danh tính hóa không phải là sự đảm bảo cho quyền riêng tư

Bài học chính là “phi danh tính hóa” không phải lúc nào cũng có nghĩa là an toàn, vĩnh viễn hay không thể truy vết. Càng chia sẻ ít thông tin cá nhân, càng ít đồng nhất trên các nền tảng và càng kiểm soát tốt hơn các tài khoản và biệt danh của mình, thì càng có ít tín hiệu để liên kết ngược lại với bạn.

Dữ liệu có thể được phi danh tính hóa trên lý thuyết, nhưng biện pháp bảo vệ mạnh mẽ nhất bắt đầu trước thời điểm đó: bằng những gì và nơi lựa chọn chia sẻ, và mức độ dễ dàng để dữ liệu đó có thể được kết nối với phần còn lại của cuộc sống kỹ thuật số. Điều đó cũng có nghĩa là phải có mục đích rõ ràng về các dịch vụ sử dụng hàng ngày và các công ty sở hữu chúng.

Các ứng dụng Proton là mã nguồn mở, không có quảng cáo và được thiết kế để tránh theo dõi và huấn luyện AI trên bất kỳ dữ liệu nào. Với mã hóa đầu cuối, mã hóa không quyền truy cập và mô hình kinh doanh được tài trợ hoàn toàn bởi cộng đồng người đăng ký trả phí, Proton không cần khai thác dữ liệu, không thể đọc hầu hết dữ liệu đó — và cũng không muốn làm vậy.