中文

KLAAD:优化注意力机制以减少生成式语言模型中的社会偏见

计算与语言 2025-07-29 v1

摘要

大型语言模型(LLM)在其输出中经常表现出社会偏见,引发了对公平性和危害性的伦理担忧。在这项工作中,我们提出了KLAAD(KL注意力对齐去偏),一种基于注意力的去偏框架,它隐式地将刻板印象和反刻板印象句子对之间的注意力分布对齐,而无需直接修改模型权重。KLAAD引入了一个结合了交叉熵、KL散度和三元组损失的复合训练目标,引导模型在有偏和无偏的上下文中保持一致的注意力,同时保持流畅性和连贯性。对KLAAD的实验评估表明,在BBQ和BOLD基准测试上,偏见缓解效果得到改善,同时对语言建模质量的影响最小。结果表明,注意力层面的对齐为减轻生成式语言模型中的偏见提供了一种原则性解决方案。

关键词

引用

@article{arxiv.2507.19962,
  title  = {KLAAD: Refining Attention Mechanisms to Reduce Societal Bias in Generative Language Models},
  author = {Seorin Kim and Dongyoung Lee and Jaejin Lee},
  journal= {arXiv preprint arXiv:2507.19962},
  year   = {2025}
}