中文

通过推理时自适应优化实现语言生成中的统一去毒与去偏

计算与语言 2023-06-05 v2 人工智能 机器学习

摘要

警告:本文包含展现攻击性与偏差的模型输出。近年来,预训练语言模型(PLMs)因能生成相当流畅的文本而在各类自然语言生成(NLG)任务中蓬勃发展。然而,观察到这些模型会捕捉并复现训练语料中的有害内容,典型如毒性语言与社会偏见,引发了严重的道德问题。已有的伦理NLG工作将去毒与去偏分开处理,这是有问题的,因为我们发现去偏后的模型仍展现毒性,而去毒后的模型甚至加剧了社会偏见。为应对该挑战,我们提出首个称为UDDIA的去毒与去偏统一框架,将这两类问题共同形式化为修正输出空间。我们从理论上将框架解释为学习一个混合加权属性的文本分布。此外,UDDIA基于参数高效调优范式,在解码时仅对少数参数进行自适应优化,且无需任何训练数据。这带来了最小的生成质量损失和以可接受计算成本实现的改进修正性能。实验结果表明,与若干强基线相比,UDDIA同时实现了去偏与去毒,并更好地平衡了效率与效果,向实用的伦理NLG迈进了一步。

关键词

引用

@article{arxiv.2210.04492,
  title  = {Unified Detoxifying and Debiasing in Language Generation via Inference-time Adaptive Optimization},
  author = {Zonghan Yang and Xiaoyuan Yi and Peng Li and Yang Liu and Xing Xie},
  journal= {arXiv preprint arXiv:2210.04492},
  year   = {2023}
}

备注

Accepted at ICLR 2023