中文

T2AV-Compass:迈向统一的文本到音视频生成评估

计算机视觉与模式识别 2025-12-25 v1

摘要

文本到音视频(T2AV)生成旨在从自然语言合成时间上连贯的视频和语义上同步的音频,然而其评估仍然碎片化,通常依赖于单模态指标或范围狭窄的基准,无法捕捉复杂提示下的跨模态对齐、指令遵循和感知真实感。为解决这一局限,我们提出了 T2AV-Compass,一个用于全面评估 T2AV 系统的统一基准,包含 500 个通过分类法驱动的流程构建的多样化复杂提示,以确保语义丰富性和物理合理性。此外,T2AV-Compass 引入了一个双层评估框架,将用于视频质量、音频质量和跨模态对齐的客观信号级指标与用于指令遵循和真实感评估的主观 MLLM-as-a-Judge 协议相结合。对 11 个代表性 T2AV 系统的广泛评估表明,即使是最强的模型在人类水平的真实感和跨模态一致性方面也仍有很大差距,在音频真实感、细粒度同步、指令遵循等方面持续存在失败。这些结果表明未来模型有巨大的改进空间,并凸显了 T2AV-Compass 作为推动文本到音视频生成发展的具有挑战性和诊断性的测试平台的价值。

关键词

引用

@article{arxiv.2512.21094,
  title  = {T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation},
  author = {Zhe Cao and Tao Wang and Jiaming Wang and Yanghai Wang and Yuanxing Zhang and Jialu Chen and Miao Deng and Jiahao Wang and Yubin Guo and Chenxi Liao and Yize Zhang and Zhaoxiang Zhang and Jiaheng Liu},
  journal= {arXiv preprint arXiv:2512.21094},
  year   = {2025}
}