议会概要中的公平表征:衡量与消除包含偏见
摘要
大型语言模型(LLMs)用于总结议会会议记录虽为提高民主参与可访问性提供了前景,但随着这些系统日益中介化用户获取政治信息——在到达用户之前筛选和构建内容——亟需关注相关的公平性考量。本文评估了5个LLMs(包括专有和开源权重模型)在对欧洲议会议程进行概括处理时,是否存在表征偏见。我们发展了一种基于归因的评估框架,用于衡量 debate summaries 中的 speaker-level 包含和误表征。在所有模型和实验中发现,speaker在最终概括中的准确度基于以下三个方面较差:(i) their speaking-order(议会中处于中间位置的演讲被系统排除),(ii) language spoken(非英语说话者被较不准确地表征),(iii) political affiliations(左派党派获益更好)。我们进一步展示了如何分解这些偏见以区分包含偏见(系统性遗漏)与幻觉偏见(系统性误表征),并探讨了不同消除策略的效果。提示词策略不影响这些偏见。相反,我们提出了一种层次化概括方法,将任务分解为较简单的提取和聚合步骤,我们展示了该方法在所有模型上显著改善了位置/说话顺序偏见。这些发现凸显了在部署LLMs用于多语言民主应用时,对领域敏感的评估指标和伦理监督的必要性。
引用
@article{arxiv.2507.14221,
title = {Fair Representation in Parliamentary Summaries: Measuring and Mitigating Inclusion Bias},
author = {Eoghan Cunningham and James Cross and Derek Greene},
journal= {arXiv preprint arXiv:2507.14221},
year = {2026}
}
备注
Extended journal version of "Identifying Algorithmic and Domain-Specific Bias in Parliamentary Debate Summarisation" (arXiv:2507.14221), which appeared at the AIDEM Workshop, ECML-PKDD 2025. This version extends the original with cross-lingual bias analysis, a two-level hierarchical summarisation method, and human annotation validation of the evaluation framework