MUG:一个通用会议理解与生成基准
计算与语言
2023-03-28 v2
摘要
通过视频会议和在线课程的长时间视频/音频录音获取信息极为低效。即便 ASR 系统将录音转写为长篇口语文档,阅读 ASR 转写文本也仅能部分加快信息查找。据观察,一系列 NLP 应用(如关键词抽取、话题分割和摘要)显著提升了用户掌握重要信息的效率。会议场景是部署这些口语处理(SLP)能力最具价值的场景之一。然而,缺乏针对这些 SLP 任务标注的大规模公开会议数据集严重阻碍了它们的进展。为推进 SLP 发展,我们建立了一个大规模通用会议理解与生成基准(MUG),以评测广泛的 SLP 任务性能,包括话题分割、话题级与会议级抽取式摘要及话题标题生成、关键词抽取和待办项检测。为支撑 MUG 基准,我们构建并发布了一个用于综合长篇 SLP 开发的大规模会议数据集——AliMeeting4MUG 语料库,其包含 654 段录制的普通话会议会话,话题覆盖多样,并对会议录音人工转写文本上的 SLP 任务进行了人工标注。据我们所知,AliMeeting4MUG 语料库迄今是规模最大的会议语料库,并支撑最多 SLP 任务。本文详细介绍了该语料库、SLP 任务与评估方法、基线系统及其性能。
引用
@article{arxiv.2303.13939,
title = {MUG: A General Meeting Understanding and Generation Benchmark},
author = {Qinglin Zhang and Chong Deng and Jiaqing Liu and Hai Yu and Qian Chen and Wen Wang and Zhijie Yan and Jinglin Liu and Yi Ren and Zhou Zhao},
journal= {arXiv preprint arXiv:2303.13939},
year = {2023}
}
备注
Paper accepted to the 2023 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2023), Rhodes, Greece