中文

落实数据保护权:面向自然语言的不可学习文本生成

机器学习 2024-11-19 v2 人工智能 计算与语言

摘要

大规模无差别数据抓取用于微调语言模型 (LM) 引发严重法律与伦理担忧,特别是对《通用数据保护条例》(GDPR) 等数据保护法规的合规性。这种做法常导致个人信息未经授权被使用,在学术与监管界引发激烈辩论。近期工作提出生成不可学习数据集(向干净数据添加不可感知噪声),使底层模型训练损失降低却无法泛化至未见测试集。虽有一定效果,但这些方法主要针对图像,且受限于需知晓目标模型等实际约束。为此,我们提出 RegText,一种向自然语言数据集注入不可感知虚假相关性的框架,在不影响语义内容的前提下使其不可学习。通过对大小语言模型的严格实证分析验证了 RegText 的效用。值得注意的是,RegText 能阻止 GPT-4o、Llama 等新型模型在生成数据上学习,导致其测试准确率低于零样本表现,为生成不可学习文本以保护公共数据铺平道路。

关键词

引用

@article{arxiv.2411.08506,
  title  = {Towards Operationalizing Right to Data Protection},
  author = {Abhinav Java and Simra Shahid and Chirag Agarwal},
  journal= {arXiv preprint arXiv:2411.08506},
  year   = {2024}
}

备注

First two authors contributed equally to this work