GDPR và AI: Một quy định được xây dựng cho một thời đại khác

Khi GDPR trở nên có hiệu lực thi hành trên khắp Vương quốc Anh và Liên minh châu Âu, trí tuệ nhân tạo như chúng ta biết ngày nay hầu như chưa tồn tại trong các công cụ kinh doanh phổ biến. Quy định này được soạn ra để điều chỉnh cách các tổ chức thu thập, xử lý và lưu trữ dữ liệu cá nhân, với các nguyên tắc cốt lõi như giới hạn mục đích, tối thiểu hóa dữ liệu và quyền được xóa. Những nguyên tắc đó hợp lý trong một thế giới của các cơ sở dữ liệu và những luồng dữ liệu được xác định rõ ràng.

AI, đặc biệt là các hệ thống tạo sinh và học máy, không hoạt động theo cách đó. Các mô hình được huấn luyện trên những tập dữ liệu khổng lồ có thể bao gồm thông tin cá nhân được thu thập, cấp phép hoặc lấy từ vô số nguồn. Một khi dữ liệu đó đã được nướng vào các trọng số của mô hình, việc cô lập, sửa chữa hoặc xóa thông tin của một cá nhân trở nên cực kỳ khó khăn, điều mà quyền được xóa của GDPR cho rằng là có thể thực hiện được. Sự không khớp giữa cách luật được thiết kế và cách các hệ thống AI thực sự vận hành nằm ở trung tâm của phân tích đang diễn ra từ Security Think Tank của Computer Weekly, nơi đang xem xét cách các tiêu chuẩn bảo vệ dữ liệu ở Vương quốc Anh và châu Âu đang chật vật theo kịp mô thức mới mà AI đã mang lại.

Những vết nứt đang lộ ra

Căng thẳng này không chỉ mang tính lý thuyết. Nó thể hiện theo những cách thực tế, hằng ngày đối với các tổ chức đang cố gắng triển khai AI một cách có trách nhiệm trong khi vẫn tuân thủ quy định. Giới hạn mục đích, ý tưởng rằng dữ liệu được thu thập vì một lý do không nên bị tái sử dụng mà không có sự đồng ý, trở nên mơ hồ khi các nhà cung cấp AI tái sử dụng dữ liệu huấn luyện qua nhiều sản phẩm hoặc tinh chỉnh mô hình trên dữ liệu ban đầu được thu thập cho một mục đích hoàn toàn khác.

Các yêu cầu về tính minh bạch cũng bị căng thẳng dưới sự phức tạp của AI. GDPR kỳ vọng các tổ chức giải thích cách dữ liệu cá nhân được xử lý và cung cấp cho cá nhân thông tin có ý nghĩa về việc ra quyết định tự động ảnh hưởng đến họ. Nhưng nhiều hệ thống AI, đặc biệt là các mô hình ngôn ngữ lớn, hoạt động như những chiếc hộp đen ngay cả đối với chính các nhà phát triển của chúng. Việc giải thích chính xác vì sao một mô hình tạo ra một đầu ra cụ thể, hoặc những điểm dữ liệu cụ thể nào đã ảnh hưởng đến nó, thường không phải là điều mà ngay cả nhà cung cấp cũng có thể trả lời đầy đủ. Như đã được khám phá trong một bài viết Think Tank liên quan của Computer Weekly về cách AI gây căng thẳng cho các quy tắc cốt lõi của GDPR, đây không phải là một chú thích kỹ thuật nhỏ. Nó đi thẳng vào trọng tâm của điều mà GDPR được thiết kế để bảo đảm: rằng con người có sự hiển thị và kiểm soát thực sự đối với dữ liệu của chính họ.

Những khoảng trống này quan trọng từ góc độ an ninh cũng như từ góc độ tuân thủ. Bảo vệ dữ liệu và an ninh mạng luôn gắn bó với nhau, và khi khuôn khổ pháp lý được cho là để thực thi vệ sinh dữ liệu tốt không khớp một cách rõ ràng với cách các hệ thống AI thực sự xử lý thông tin, các tổ chức có thể rơi vào những điểm mù. Dữ liệu nhạy cảm có thể bị đưa vào các công cụ AI mà không có một bản kiểm kê rõ ràng về nơi nó đi, ai có thể truy cập nó, hoặc nó tồn tại trong bao lâu, tạo ra đúng kiểu lan tràn dữ liệu không được quản lý mà các đội an ninh dành nhiều năm để cố gắng loại bỏ.

Suy nghĩ lại về tuân thủ trong thời đại AI

Phân tích của Security Think Tank cho thấy rằng việc vá GDPR từng phần có thể là chưa đủ. Thay vào đó, cả các tổ chức lẫn các cơ quan quản lý đều cần suy nghĩ lại về việc tuân thủ trông như thế nào khi dữ liệu không nằm trong một cơ sở dữ liệu tĩnh mà chảy qua các đường ống huấn luyện, cập nhật mô hình và các nền tảng AI của bên thứ ba. Điều đó có nghĩa là quản trị dữ liệu mạnh mẽ hơn trước khi thông tin chạm tới bất kỳ hệ thống AI nào: biết dữ liệu cá nhân nào tồn tại, phân loại mức độ nhạy cảm của nó, và hạn chế những gì được đưa vào các công cụ AI ngay từ đầu.

Đối với các cơ quan quản lý ở Vương quốc Anh và châu Âu, điều này cũng đặt ra câu hỏi về việc thực thi. Các nguyên tắc của GDPR vẫn vững chắc về tinh thần, nhưng việc áp dụng chúng cho AI đòi hỏi hướng dẫn diễn giải mới, và có thể cả các quy tắc mới, để giải quyết những vấn đề như nguồn gốc dữ liệu huấn luyện, việc huấn luyện lại mô hình sau các yêu cầu xóa, và trách nhiệm giải trình khi các nhà cung cấp AI và khách hàng của họ chia sẻ trách nhiệm tuân thủ.

Điều này có nghĩa gì với bạn

Nếu tổ chức của bạn sử dụng các công cụ AI, dù đó là chatbot, một nền tảng phân tích nội bộ, hay một dịch vụ bên thứ ba được xây dựng trên các mô hình ngôn ngữ lớn, thì việc tuân thủ GDPR và AI không phải là điều bạn có thể mặc định cho rằng đã được xử lý. Ngay cả các doanh nghiệp nhỏ hơn sử dụng các sản phẩm AI đóng gói sẵn cũng có thể bị phơi nhiễm nếu dữ liệu cá nhân cuối cùng bị xử lý theo những cách mà chính sách bảo mật của nhà cung cấp không giải thích rõ ràng.

Đối với các cá nhân, thông điệp rút ra là một lời nhắc nhở rằng dữ liệu được chia sẻ với các dịch vụ hỗ trợ AI có thể không dễ truy xuất hoặc xóa như dữ liệu được lưu trữ trong một tài khoản truyền thống. Một khi thông tin được sử dụng để huấn luyện hoặc tinh chỉnh một mô hình, việc thực thi các quyền như quyền được xóa trở nên phức tạp hơn nhiều trên thực tế so với điều mà luật giả định.

Những điểm cần hành động

Trước khi áp dụng hoặc tiếp tục sử dụng các công cụ AI có liên quan đến dữ liệu cá nhân, hãy cân nhắc những bước sau:

  • Hỏi trực tiếp các nhà cung cấp liệu dữ liệu của bạn có được dùng để huấn luyện mô hình hay không và liệu sau này nó có thể được xóa hoàn toàn hay không.
  • Lập bản đồ những dữ liệu cá nhân chảy vào bất kỳ hệ thống AI nào mà tổ chức của bạn sử dụng, bao gồm cả các công cụ của bên thứ ba.
  • Xem xét các chính sách bảo mật của các sản phẩm AI với cùng mức độ kỹ lưỡng như bạn áp dụng cho bất kỳ bên xử lý dữ liệu nào khác.
  • Luôn cập nhật về các hướng dẫn đang phát triển, vì các quy tắc tuân thủ GDPR và AI có khả năng sẽ tiếp tục thay đổi khi các cơ quan quản lý bắt kịp.

Khoảng cách giữa GDPR và AI sẽ không tự biến mất. Cho đến khi quy định bắt kịp, việc giữ thận trọng và được thông tin là biện pháp bảo vệ tốt nhất mà các cá nhân và tổ chức có.