用于受控生成的对比困惑度:在大语言模型解毒中的应用
计算与语言
2025-06-02 v3 机器学习
摘要
大语言模型(LLMs)生成有毒内容仍然是语言技术安全部署的关键挑战。我们提出了一种新颖的框架,通过使用基于原型的对比困惑度目标微调 LLMs,实现隐式知识编辑和受控文本生成。我们方法的核心是构建困难负样本——通过对抗性改写生成的有毒输出,使其在语义上与非有毒对应样本相似且模型概率相近。通过在这些具有挑战性且真实的样本对上进行训练,我们的方法确保了稳健且稳定的对比优化。在解毒领域的实验结果表明,我们的方法显著减少了有毒内容的生成,同时在常识推理和阅读理解等下游任务上保持了强大的性能。我们的发现突显了利用困难负样本进行属性感知微调的有效性。
引用
@article{arxiv.2401.08491,
title = {Contrastive Perplexity for Controlled Generation: An Application in Detoxifying Large Language Models},
author = {Tassilo Klein and Moin Nabi},
journal= {arXiv preprint arXiv:2401.08491},
year = {2025}
}
备注
Accepted to ACL 2025 (Main Track)