CMD:一种上下文感知的模型自解毒框架
计算与语言
2024-10-14 v3
摘要
文本解毒旨在最小化语言模型产生有毒内容的风险。现有的直接约束模型输出或进一步在非有毒语料上训练模型的解毒方法,未能在解毒效果与生成质量之间取得良好平衡。该问题源于忽视了上下文所施加的约束,因为语言模型被设计为生成与上下文紧密匹配的输出,而解毒方法力求确保输出安全,即便其在语义上偏离上下文。有鉴于此,我们引入一种上下文感知的模型自解毒(CMD)框架,同时关注上下文与解毒过程,即先对上下文解毒,再使语言模型沿安全上下文生成。具体而言,CMD 框架包含两阶段:利用语言模型合成数据,并应用这些数据训练。我们还引入了一种有毒对比损失,促使模型生成远离负向有毒样本。在多种 LLM 上的实验验证了我们的 MSD 框架的有效性,其相较基线可取得最佳性能。
引用
@article{arxiv.2308.08295,
title = {CMD: a framework for Context-aware Model self-Detoxification},
author = {Zecheng Tang and Keyan Zhou and Juntao Li and Yuyang Ding and Pinzheng Wang and Bowen Yan and Rejie Hua and Min Zhang},
journal= {arXiv preprint arXiv:2308.08295},
year = {2024}
}