AQAScore: 通过音频问答评估文本到音频生成中的语义对齐
音频与语音处理
2026-01-22 v1 人工智能
计算与语言
机器学习
声音
摘要
尽管文本到音频生成在真实感和多样性方面取得了显著进展,但评估指标的发展却未能跟上步伐。广泛采用的方法,通常基于嵌入相似度(如CLAPScore),能有效衡量一般相关性,但在细粒度语义对齐和组合推理方面仍然有限。为解决此问题,我们引入了AQAScore,一个与骨干网络无关的评估框架,它利用了音频感知大语言模型(ALLMs)的推理能力。AQAScore将评估重新表述为概率语义验证任务;它不依赖开放式文本生成,而是通过计算对目标语义查询回答“是”的确切对数概率来估计对齐程度。我们在多个基准测试上评估了AQAScore,包括人工评分的相关性、成对比较和组合推理任务。实验结果表明,与基于相似度的指标和生成式提示基线相比,AQAScore始终与人类判断具有更高的相关性,显示了其在捕捉细微语义不一致性方面的有效性,并能随底层ALLMs能力的提升而扩展。
引用
@article{arxiv.2601.14728,
title = {AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering},
author = {Chun-Yi Kuan and Kai-Wei Chang and Hung-yi Lee},
journal= {arXiv preprint arXiv:2601.14728},
year = {2026}
}
备注
Manuscript in progress