中文

联合音视频生成模型是否理解物理?

声音 2026-05-11 v1 人工智能 计算机视觉与模式识别 多媒体

摘要

联合音视频生成模型正快速接近专业制作质量,这引发了一个核心问题:它们是否理解音视频物理,抑或仅生成符合常规感的声音和帧而违反真实世界一致性?我们引入AV-Phys Bench,用于评估联合音视频生成中物理常识。AV-Phys Bench涵盖了三个场景类别:稳态、事件转换和环境转换。它覆盖来自真实场景中绘制的物理基础子类别,外加反AV-物理提示,这些提示故意要求生成违反物理一致性的音视频行为。每一次生成都沿用五个维度进行评估:视觉语义遵循性、音频语义遵循性、视觉物理常识、音频物理常识以及跨模态物理常识。在三个专有模型和四个开源模型上,我们发现Seedance 2.0在整体上表现最佳,但所有模型都远未达到稳健的物理理解。在事件驱动和环境驱动转换上,性能会急剧下降,甚至强大的专有系统在反AV-物理提示下也会崩溃。我们进一步引入AV-Phys Agent,一种采用ReAct风格的评估器,将多模态语言模型与确定性声学测量工具结合,产生的排名与人类评分高度一致。我们的结果确定了跨模态物理一致性和以转换驱动的场景动态作为联合音视频生成的关键开放挑战。

关键词

引用

@article{arxiv.2605.07061,
  title  = {Do Joint Audio-Video Generation Models Understand Physics?},
  author = {Zijun Cui and Xiulong Liu and Hao Fang and Mingwei Xu and Jiageng Liu and Zexin Xu and Weiguo Pian and Shijian Deng and Feiyu Du and Chenming Ge and Yapeng Tian},
  journal= {arXiv preprint arXiv:2605.07061},
  year   = {2026}
}

备注

Preprint. Full abstract appears in the PDF