中文

LongSpeech:面向长语音转录、翻译与理解的可扩展基准

声音 2026-01-21 v1

摘要

音频语言模型的最新进展在短时、片段级语音任务上取得了显著成功。然而,会议转录、口语文档理解和对话分析等实际应用需要能够处理长格式音频并进行推理的鲁棒模型。在这项工作中,我们提出了 LongSpeech,一个专门设计用于评估和推进语音模型在长时音频上能力的大规模可扩展基准。LongSpeech 包含超过 100,000 个语音片段,每个长约 10 分钟,带有丰富的 ASR、语音翻译、摘要、语言检测、说话人计数、内容分离和问答标注。我们引入了一个可复现的流水线,用于从多样化来源构建长格式语音基准,支持未来的扩展。我们对最先进模型的初步实验揭示了显著的性能差距,模型通常在一个任务上表现出色而牺牲其他任务,并在更高层次的推理上遇到困难。这些发现凸显了我们基准的挑战性。我们的基准将向研究界公开提供。

关键词

引用

@article{arxiv.2601.13539,
  title  = {LongSpeech: A Scalable Benchmark for Transcription, Translation and Understanding in Long Speech},
  author = {Fei Yang and Xuanfan Ni and Renyi Yang and Jiahui Geng and Qing Li and Chenyang Lyu and Yichao Du and Longyue Wang and Weihua Luo and Kaifu Zhang},
  journal= {arXiv preprint arXiv:2601.13539},
  year   = {2026}
}

备注

ICASSP 2026