TTA-Bench:一个用于评估文本到音频模型的综合基准
声音
2025-09-03 v1 音频与语音处理
摘要
文本到音频 (TTA) 生成取得了快速进展,但当前的评估方法仍然狭窄,主要关注感知质量,而忽略了鲁棒性、泛化能力和伦理问题。我们提出了 TTA-Bench,这是一个用于在功能性能、可靠性和社会责任方面评估 TTA 模型的综合基准。它涵盖了包括准确性、鲁棒性、公平性和毒性在内的七个维度,并包含通过自动和手动方法生成的 2,999 个多样化提示。我们引入了一个统一的评估协议,将客观指标与来自专家和普通用户的超过 118,000 条人工标注相结合。十个 state-of-the-art 模型在此框架下进行了基准测试,提供了关于其优势和局限性的详细见解。TTA-Bench 为 TTA 系统的整体和负责任评估确立了新标准。数据集和评估工具已在 https://nku-hlt.github.io/tta-bench/ 开源。
引用
@article{arxiv.2509.02398,
title = {TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models},
author = {Hui Wang and Cheng Liu and Junyang Chen and Haoze Liu and Yuhang Jia and Shiwan Zhao and Jiaming Zhou and Haoqin Sun and Hui Bu and Yong Qin},
journal= {arXiv preprint arXiv:2509.02398},
year = {2025}
}