中文

多样场景下长篇语音生成的全面基准测试

音频与语音处理 2026-05-28 v1

摘要

近期的语音生成技术进展使得高保真合成成为可能,但在长上下文条件下评估模型的系统性评估仍大体未被探索。对于长篇语音,必须进行全面的评估基准测试,这有两个主要原因:1)现有测试场景往往局限于有限领域,与多样化的下游应用之间存在显著鸿沟;2)现有指标忽视了诸如一致性和连贯性等关键长文本因素,难以可靠地概括。为此,我们提出了Swanbench-Speech,一个全面的基准测试,将长篇语音质量分解为具体且可分离的维度。SwanBench-Speech具有三个关键特性。1)丰富的语音场景:我们聚焦于长篇语音生成和对话生成,覆盖声学、语义和表达等挑战,包含1,101个样本,涵盖17种常见语音场景;2)全面的评估维度:沿声学、语义和表达三个维度,SwanBench-Speech定义了一套自动化评估协议,包含七个指标,以提供全面、准确且标准化的评估;3)有价值的见解:通过大量实验,我们揭示了当前模型在高度表达场景下仍存在挑战,并且在一致性和层次结构方面与真实录音之间存在显著差距。

关键词

引用

@article{arxiv.2605.28618,
  title  = {Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios},
  author = {Changhao Pan and Rui Yang and Han Wang and Zhuan Zhou and Xuming He and Wenxiang Guo and Ziyue Jiang and Ruiqi Li and Yu Zhang and Chenyuhao Wen and Ke Lei and Xiang Yin and Jingyu Lu and Zhiyuan Zhu and Zhou Zhao},
  journal= {arXiv preprint arXiv:2605.28618},
  year   = {2026}
}

备注

Accepted by ACL 2026(Findings). 36pages, 14figures