中文

RVCBench:语音克隆鲁棒性基准测试

声音 2026-05-26 v2 多媒体 音频与语音处理

摘要

现代语音克隆,也称为零样文本转语音(TTS),可以仅从几秒钟的参考音频合成与目标说话者匹配的语音,使能个性化语音界面和配音等应用。在实际情况下,这些系统常面临噪声参考音频、不完美的文本提示、多语言和长篇生成、后处理以及对抗性扰动等问题,可能削弱鲁棒性。尽管编解码器标记语言模型和基于扩散的TTS在快速进步,但在真实部署偏移下的鲁棒性仍未得到充分探索。本文引入RVCBench,一个用于评估语音克隆鲁棒性的全面数据集和基准测试。RVCBench提供覆盖受控文本-音频配对、多语言和长篇场景、情感提示、后处理条件以及被动或主动音频扰动的任务对齐测试。在18次鲁棒性评估、225位说话者和14,370段语音方面,RVCBench支持输入敏感性、生成稳定性、输出韧性、扰动鲁棒性、说话者相似性和深度伪造检测可分性的统一评估。我们评估了18个代表性的开源语音克隆模型,揭示了在内容一致性、说话者相似性、长期稳定性、后处理韧性、对抗鲁棒性和检测器面向可分性方面存在的系统性漏洞。我们发布代码和数据集以支持可重复评估以及对稳健语音克隆、语音合成和音频生成的未来研究。代码:https://github.com/Nanboy-Ronan/RVCBench。数据集:https://huggingface.co/datasets/Nanboy/RVCBench。

关键词

引用

@article{arxiv.2602.00443,
  title  = {RVCBench: Benchmarking the Robustness of Voice Cloning Across Modern Audio Generation Models},
  author = {Ruinan Jin and Xinting Liao and Hanlin Yu and Deval Pandya and Xiaoxiao Li},
  journal= {arXiv preprint arXiv:2602.00443},
  year   = {2026}
}

备注

65 pages, 10 figures