通过实例级前缀实现大语言模型的细粒度去毒化
计算与语言
2024-02-27 v2
摘要
通过训练大语言模型(LLM),在自然语言处理(NLP)任务中取得了令人瞩目的成果。然而,这些模型有时会对某些提示产生有毒内容,如侮辱、威胁和脏话,从而限制了其实际应用。为了解决这个问题,已经采用了各种基于微调和基于解码的方法来减轻毒性。然而,这些方法通常需要额外的成本,如高质量的训练数据或辅助模型。本文提出了一种通过实例级前缀的细粒度去毒化方法(FGDILP),无需额外成本即可减轻有毒文本。具体来说,FGDILP在实例级别上将使用正面前缀提示的注意力空间中的上下文表示与多个负面前缀提示进行对比。这允许构建细粒度的子毒性向量,通过融合它们来纠正原始提示下的正常生成过程,从而实现协同去毒化。我们验证了FGDILP能够在话语和上下文级别实现对毒性的可控文本生成。我们的方法在去毒化方面优于基于提示的基线,尽管在生成流畅性和多样性上略有损失。
引用
@article{arxiv.2402.15202,
title = {Fine-Grained Detoxification via Instance-Level Prefixes for Large Language Models},
author = {Xin Yi and Linlin Wang and Xiaoling Wang and Liang He},
journal= {arXiv preprint arXiv:2402.15202},
year = {2024}
}