机器学习者应承认大型语言模型作为个人数据的法律含义
机器学习
2025-06-19 v2 人工智能
计算机与社会
摘要
GPT 知道你吗?答案取决于你的公众认知程度;然而,如果你的信息曾公开于网站,答案可能是肯定的。大型语言模型(LLMs)在一定程度上会记忆训练数据。因此,即便 LLM 只记忆了少量个人数据,通常也落在数据保护法律的范围内。如果某人被识别或可被识别,法律含义将变得广泛而深远。即使在训练阶段结束后,LLM 也需遵守欧盟通用数据保护条例(GDPR)的要求。为支撑我们的论点:(1)我们重申 LLM 在推理阶段会输出训练数据,无论是原文样样,还是以概括性形式呈现。(2)我们表明,一些 LLM 可被视为自身的个人数据。这触发了一连串的数据保护影响,如数据主体权利,包括访问权、纠正权或删除权。这些权利延伸至嵌入 AI 模型中的信息。(3)本文主张,机器学习研究人员在整个机器学习开发生命周期内(包括数据收集与精选、模型在 GitHub 或 Hugging Face 等平台的提供)都必须承认 LLM 作为个人数据的法律含义。(4)我们提出了不同方法,供机器学习研究社区应对这些法律含义。本文为改善数据保护法律与 LLM 技术能力之间的对齐提供了起点。我们的发现凸显了法律领域与机器学习社区之间需要更多互动的需求。
引用
@article{arxiv.2503.01630,
title = {Machine Learners Should Acknowledge the Legal Implications of Large Language Models as Personal Data},
author = {Henrik Nolte and Michèle Finck and Kristof Meding},
journal= {arXiv preprint arXiv:2503.01630},
year = {2025}
}