AdvSumm:对抗训练用于文本概括中的偏见缓解
计算与语言
2025-09-23 v2
摘要
大型语言模型( LLMs)在文本概括方面取得了令人瞩目的性能,并在实际应用中日益得到部署。然而,这些系统往往继承自预训练数据中的关联性和框架偏见,导致在下游任务中产生不恰当或不公平的输出。本文提出AdvSumm(对抗概括),一个面向偏见缓解的域无关训练框架,通过提升泛化能力来缓解文本概括中的偏见。灵感来源于对抗鲁棒性,AdvSumm引入了新的Perturber组件,在序列到序列模型的嵌入层上应用梯度引导的扰动,增强了模型对输入变化的鲁棒性。我们实证表明,AdvSumm有效减少了概括中不同类型的偏见,具体包括人种偏见和政治框架偏见,而不会损害概括质量。相较于标准变换器和诸如回译等数据增强技术,AdvSumm在各类基准数据集上实现了更强的偏见缓解效果。
引用
@article{arxiv.2506.06273,
title = {AdvSumm: Adversarial Training for Bias Mitigation in Text Summarization},
author = {Mukur Gupta and Nikhil Reddy Varimalla and Nicholas Deas and Melanie Subbiah and Kathleen McKeown},
journal= {arXiv preprint arXiv:2506.06273},
year = {2025}
}