NVBench:面向非语言声音合成的基准测试
声音
2026-04-22 v2
摘要
非语言声音(Non-verbal vocalizations, NVVs)如笑声、叹息和啜泣是实现人类化语音合成的关键要素,但标准化评估在联合评估系统是否能够生成预期 NVVs、正确放置它们且不损害语音质量方面仍有限。我们提出 Non-verbal Vocalization Benchmark(NVBench),一个双语(英语/中文)基准测试,用于评估包含 NVVs 的语音合成。NVBench 将统一的 45 种 NVV 类型与精选双语数据集相结合,引入多轴协议,将一般语音的自然度和质量与 NVV-specific 的可控性、放置和显著性分离。我们使用客观指标、听觉测试和基于 LLM 的多评委评估对 15 种 TTS 系统进行基准测试。结果显示,NVVs 可控性常常与质量脱节,而低信噪比的口头线索和持续时长的情感 NVVs 仍是持久的瓶颈。NVBench 在统一、标准化的框架下,使得在多样化控制界面下进行公平的系统间比较成为可能。
引用
@article{arxiv.2604.16211,
title = {NVBench: A Benchmark for Speech Synthesis with Non-Verbal Vocalizations},
author = {Liumeng Xue and Weizhen Bian and Jiahao Pan and Wenxuan Wang and Yilin Ren and Boyi Kang and Jingbin Hu and Ziyang Ma and Shuai Wang and Xinyuan Qian and Hung-yi Lee and Yike Guo},
journal= {arXiv preprint arXiv:2604.16211},
year = {2026}
}