基准化单因素物理视频到音频生成
计算机视觉与模式识别
2026-05-29 v1 多媒体
声音
音频与语音处理
摘要
生成式视频到音频 (V2A) 模型会产生高度可信的音轨,但是否捕捉到了潜在的物理过程仍不明确。现有评估强调感知逼真度,忽略了在受控干预下的物理正确性。在本文中,我们引入 FlatSounds 这一基准,通过:1) 控制性反事实对,其中变化单一物理因素,2) 单视频模式测试,用于探测内部一致性和方向性趋势。这些设置测试生成音频是否正确反映特定物理属性和时间。我们评估了最先进的模型,发现一致的权衡:模型更依赖文本标题而非视觉流来推断物理和语义。标题通常会提高物理和语义准确性,但反之会降低时间对齐。我们的结果表明,需要超越音频质量,直至从像素中直接学习物理过程。最后,我们发现我们的物理基准指标与人类偏好测试高度相关。项目网页:https://research.nvidia.com/labs/cosmos-lab/flatsounds/
引用
@article{arxiv.2605.30339,
title = {Benchmarking Single-Factor Physical Video-to-Audio Generation},
author = {Tingle Li and Siddharth Gururani and Kevin J. Shih and Gantavya Bhatt and Sang-gil Lee and Zhifeng Kong and Arushi Goel and Gopala Anumanchipalli and Ming-Yu Liu},
journal= {arXiv preprint arXiv:2605.30339},
year = {2026}
}
备注
CVPR 2026