中文

通过利用LLM对齐机制使数据难以被学习

计算与语言 2026-01-08 v1

摘要

大语言模型(LLMs)正在训练于大规模异构文本语料库,引发严重关切关于未授权使用专有或个人数据进行模型训练的问题。本工作聚焦于如何在现实中的黑盒环境中保护数据免受模型学习。我们提出了“声明注入”(Disclaimer Injection),一种新颖的数据层防御措施,使文本对LLM不可学习。该方法不依赖模型侧控制或显式数据删除,而是利用模型自身的对齐机制:通过注入精心设计的对齐触发声明以防止有效学习。通过层级分析,我们发现针对此类受保护数据的微调会导致对齐相关层的持续激活,使对齐约束即使在常见输入上也会覆盖任务学习。因此,训练此类数据的数据模型表现出与标准微调相比的显著且系统性的性能下降。我们的结果识别了对齐行为作为一种前所未有的数据保护杠杆,并据称首次在LLM规模范围内实现了无需访问或修改训练管道即可限制数据可学习性的实用方法。

关键词

引用

@article{arxiv.2601.03401,
  title  = {Rendering Data Unlearnable by Exploiting LLM Alignment Mechanisms},
  author = {Ruihan Zhang and Jun Sun},
  journal= {arXiv preprint arXiv:2601.03401},
  year   = {2026}
}