ParaPO:对齐语言模型以减少逐字复制预训练数据
计算与语言
2025-07-21 v2 人工智能
机器学习
摘要
语言模型(LMs)即使在非对抗性情境下,也会记忆并逐字复现其预训练数据中的片段,这引发了关于版权、抄袭、隐私和创造性的担忧。我们引入 Paraphrase Preference Optimization(ParaPO),这是一种后训练方法,通过微调 LM 来减少意外复述,同时保持其整体实用性。ParaPO 训练 LM 在记忆片段的改写版本中优先于来自预训练数据的原始逐字内容。为在适当情况下保持对著名引文的记忆能力,我们开发了 ParaPO 的一种变体,该变体使用系统提示控制复述行为。在我们对 Llama3.1-8B 的评估中,ParaPO 在所有测试数据集上均显著降低了复述率(例如,在创意写作中将复述指标从 17.3 降至 12.9),而先前工作中用于缓解复述的无学习方法在其针对的无学习领域之外效果较差(从 17.3 降至 16.9)。当应用于 instruction-tuned Tulu3-8B 模型时,ParaPO 配合系统提示成功地在不复述的情境下保留了著名引文记忆,同时降低了意外复述(在创意写作中从 8.7 降至 6.3)。相比之下,在没有 ParaPO 调优的情况下,使用“不要复述”提示词仅产生轻微降低(从 8.7 降至 8.4)。
引用
@article{arxiv.2504.14452,
title = {ParaPO: Aligning Language Models to Reduce Verbatim Reproduction of Pre-training Data},
author = {Tong Chen and Faeze Brahman and Jiacheng Liu and Niloofar Mireshghallah and Weijia Shi and Pang Wei Koh and Luke Zettlemoyer and Hannaneh Hajishirzi},
journal= {arXiv preprint arXiv:2504.14452},
year = {2025}
}