音频图灵测试:基于大语言模型的中文文本到语音系统人类化评估基准
声音
2025-05-19 v1 人工智能
计算与语言
人机交互
机器学习
音频与语音处理
摘要
近期大型语言模型(LLM)的进展显著提升了文本到语音(TTS)系统的控制能力,增强了语音风格、自然性和情感表达,使TTS系统更接近人类水平。尽管平均意见分数(MOS)仍是TTS系统评估的标准,但其存在主观性、环境一致性差及可解释性有限的问题。现有评估数据集也缺乏多维设计,常忽略说话风格、上下文多样性及陷阱语料,尤其在中文TTS评估中更为明显。为解决这些挑战,我们引入音频图灵测试(Audio Turing Test, ATT),构建与之配套的多维中文语料库ATT-Corpus,并提供一种受图灵测试启发的简洁评估协议。ATT不依赖复杂的MOS量表或直接模型比较,而是要求评估者判断语音是否听起来像人类。这种简化方式减少了评分偏差,提高了评估鲁棒性。为支持快速模型开发,我们还基于人类判断数据对Qwen2-Audio-Instruct进行微调,构建出Auto-ATT用于自动评估。实验结果表明,ATT通过其多维设计有效区分模型在具体能力维度上的表现。Auto-ATT也显示出与人类评估高度一致,证明其作为快速可靠评估工具的价值。ATT-Corpus及Auto-ATT可在ATT Hugging Face Collection(https://huggingface.co/collections/meituan/audio-turing-test-682446320368164faeaf38a4)中获取。
引用
@article{arxiv.2505.11200,
title = {Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese},
author = {Xihuai Wang and Ziyi Zhao and Siyu Ren and Shao Zhang and Song Li and Xiaoyu Li and Ziwen Wang and Lin Qiu and Guanglu Wan and Xuezhi Cao and Xunliang Cai and Weinan Zhang},
journal= {arXiv preprint arXiv:2505.11200},
year = {2025}
}
备注
Under Review