中文

揭开引擎盖:探究会议摘要中的自动评估指标

计算与语言 2025-02-19 v2 人工智能

摘要

会议摘要已成为一项关键任务,考虑到在线互动的增加。虽然新技术不断被引入,但它们的评估使用的指标并非设计用于捕捉会议特定的错误,从而削弱了有效评估。本文通过将自动指标分数与人类评估在广泛的错误分类上进行关联,调查了常用的自动指标捕捉了什么以及它们掩盖了哪些错误。我们首先对英文会议摘要进行了全面的文献综述,以定义关键挑战,如说话者动态和上下文轮换,以及错误类型,如信息缺失和语言不准确,这些概念以前在该领域定义松散。我们通过使用来自通用摘要QMSum数据集的基于Transformer的序列到序列和自回归模型的带注释的转录和摘要,研究了特征挑战与错误之间的关系。通过实验验证,我们发现不同的模型架构对会议转录中的挑战反应不同,导致挑战与错误之间出现不同的显著联系。当前默认使用的指标难以捕捉可观察的错误,显示出弱到中等的相关性,而三分之一的关联显示出错误掩盖的趋势。只有一部分指标能准确反应特定错误,而大多数相关性要么无反应,要么未能反映错误对摘要质量的影响。

关键词

引用

@article{arxiv.2404.11124,
  title  = {What's under the hood: Investigating Automatic Metrics on Meeting Summarization},
  author = {Frederic Kirstein and Jan Philip Wahle and Terry Ruas and Bela Gipp},
  journal= {arXiv preprint arXiv:2404.11124},
  year   = {2025}
}