中文

LIDAO:面向(大型)语言模型去偏的有限干预

机器学习 2024-06-05 v1 计算与语言

摘要

大型语言模型在各种自然语言生成任务上取得了令人印象深刻的性能。尽管如此,它们会生成针对某些人口群体(例如女性)存在偏见的负面和有害内容,引发了严重的公平性问题。作为补救措施,先前的工作通过移除态度或人口统计信息来干预生成,这不可避免地降低了生成质量,并导致了显著的“公平-流畅性”权衡。然而,为了达到期望的公平水平,流畅性在多大程度上“必须”受到影响仍未得到充分探索。在这项工作中,我们从信息论的角度进行了首次正式研究。我们表明,先前的方法对于去偏来说是过度的,并提出了LIDAO,一个通用的框架,可以在可证明的情况下以更好的流畅性对(大型)语言模型进行去偏。我们进一步在对抗性场景中增强了LIDAO的鲁棒性,在这种场景中,精心设计的提示可能会刺激表现出指令遵循能力的大型语言模型生成存在公平性问题的文本,而这种问题仅在同时考虑提示时才会出现。在参数范围从0.7B到7B的三个语言模型上的实验证明了我们方法的优越性。

关键词

引用

@article{arxiv.2406.00548,
  title  = {LIDAO: Towards Limited Interventions for Debiasing (Large) Language Models},
  author = {Tianci Liu and Haoyu Wang and Shiyang Wang and Yu Cheng and Jing Gao},
  journal= {arXiv preprint arXiv:2406.00548},
  year   = {2024}
}