基于重排序的方法用于生成无偏见的视角概括
计算与语言
2025-06-23 v1
摘要
在如政治视角概括等实际场景中,生成无偏见的概括仍是大型语言模型(LLM)的关键应用。然而,现有的评估框架依赖于衡量覆盖性和忠实性等关键属性的传统指标,却未验证其适用性;而发展更优概括器的努力仍处于初级阶段。我们通过(1)识别衡量视角概括质量的可靠指标,和(2)探讨超越零样本推理的基于LLM的方法效能来弥补这些差距。具体而言,我们构建了一个使用人工标注的测试集,用于评估指标可靠性,结果显示传统指标的表现不如语言模型基准指标,而后者被证明是强大的评估工具。借助这些指标,我们表明重排序方法可取得优异成绩,进一步利用人工生成的重排序标注数据进行偏好微调可进一步提升性能。我们的发现旨在为视角概括方法的可靠评估与开发作出贡献。
引用
@article{arxiv.2506.15925,
title = {Reranking-based Generation for Unbiased Perspective Summarization},
author = {Narutatsu Ri and Nicholas Deas and Kathleen McKeown},
journal= {arXiv preprint arXiv:2506.15925},
year = {2025}
}
备注
ACL 2025 Findings