中文

AudioEval: 文本到音频生成的自动双视角多维度评估

声音 2026-01-30 v2 音频与语音处理

摘要

文本到音频(TTA)生成技术发展迅速,但评估仍然具有挑战性,因为人工听力研究成本高昂,且现有的自动评估指标仅能捕捉感知质量的有限方面。我们引入了 AudioEval,这是一个大规模的 TTA 评估数据集,包含来自 24 个系统的 4,200 个生成音频样本(11.7 小时),以及来自专家和非专家在五个维度(愉悦度、有用性、复杂度、质量和文本对齐)上的 126,000 条评分。利用 AudioEval,我们对多种自动评估器进行了基准测试,以比较不同模型系列在视角和维度层面的差异。我们还提出了 Qwen-DisQA 作为一个强大的参考基线:它联合处理提示和生成的音频,以预测两个标注者群体的多维度评分,通过分布预测对评分者分歧进行建模,并取得了强劲的性能。我们将发布 AudioEval 以支持 TTA 评估的未来研究。

关键词

引用

@article{arxiv.2510.14570,
  title  = {AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation},
  author = {Hui Wang and Jinghua Zhao and Junyang Cheng and Cheng Liu and Yuhang Jia and Haoqin Sun and Jiaming Zhou and Yong Qin},
  journal= {arXiv preprint arXiv:2510.14570},
  year   = {2026}
}