中文

超越文字稿:利用音频进行迭代同行编辑,实现高质量的人类对话语音摘要

计算与语言 2026-05-19 v1

摘要

语音摘要任务缺乏足够的既定基准。创建新的基准数据集需要人工标注,因为大型语言模型可能会在数据集中嵌入系统性错误和偏见。我们测试了十种标注工作流程,讨论了输入模态(音频、文字稿或两者)以及编辑方式(自我编辑或同行编辑)在使用人类标注员进行摘要生成时的潜在质量权衡。我们将人类基于音频的摘要与人类基于文字稿的摘要进行比较,以追踪不同信息模态对摘要质量的影响。我们还将人类输出与四个大型语言模型基准(三种文本,一种音频)进行比较,以检验人类编写的摘要是否不如高度流畅的自动化输出信息丰富。我们发现,基于音频的摘要在信息性和压缩程度方面都不如文字稿摘要。然而,结合音频的迭代同行编辑可消除了这一差异,使基于音频的摘要信息性与文字稿摘要和大型语言模型摘要相当。这一发现验证了在受众和语音信息均衡衡的数据集创建中使用人类标注员进行迭代同行编辑的有效性。即使在文字稿不可用的情境下,这也为关键数据集收集提供了可能。

关键词

引用

@article{arxiv.2605.17652,
  title  = {Beyond Transcripts: Iterative Peer-Editing with Audio Unlocks High-Quality Human Summaries of Conversational Speech},
  author = {Kaavya Chaparala and Thomas Thebaud and Jesús Villalba López and Laureano Moro-Velazquez and Peter Viechnicki and Najim Dehak},
  journal= {arXiv preprint arXiv:2605.17652},
  year   = {2026}
}

备注

Accepted in LREC 2026