中文

基于对比解码的参数高效去毒化

计算与语言 2024-01-17 v1 人工智能

摘要

近年来,自然语言生成领域取得了显著进展,包括可控文本生成技术的发展。然而,控制生成文本的属性仍然是一个挑战,尤其是在旨在避免诸如毒性等不良行为时。在这项工作中,我们引入了去毒化生成器(DETOXIGEN),这是一种推理时算法,可引导生成过程远离不期望的风格。DETOXIGEN 由一个预训练语言模型(生成器)和一个去毒器组成的集成系统。去毒器特意在代表不良属性的毒性数据上进行训练,鼓励其专门生成该风格的文本。在实际生成过程中,我们在每个解码步骤使用训练好的去毒器来产生不良标记,供生成器进行对比。这种方法直接告知生成器避免生成去毒器认为可能性很高的标记。我们在常用的 REALTOXICITYPROMPTS 基准(Gehman et al., 2020)上,使用各种语言模型作为生成器对 DETOXIGEN 进行了评估。我们发现,它在去毒化指标上显著优于先前的方法,同时不损害生成质量。此外,去毒器是通过使用与生成器相同的主干语言模型进行软提示微调获得的。因此,DETOXIGEN 在解码时仅需将来自去毒器虚拟标记的极少额外权重加载到 GPU 内存中,使其成为一种有前景的轻量级、实用且参数高效的去毒化策略。

关键词

引用

@article{arxiv.2401.06947,
  title  = {Parameter-Efficient Detoxification with Contrastive Decoding},
  author = {Tong Niu and Caiming Xiong and Semih Yavuz and Yingbo Zhou},
  journal= {arXiv preprint arXiv:2401.06947},
  year   = {2024}
}