PAVAS:物理感知视频到音频合成
计算机视觉与模式识别
2026-03-31 v2 多媒体
声音
摘要
最近的视频到音频(V2A)生成技术在感知质量和时间同步方面取得了令人印象深刻的进展,但大多数模型仍依赖外观驱动,仅捕捉视觉-声学相关性,而不考虑塑造真实声音的物理因素。我们提出物理感知视频到音频合成(PAVAS),一种将物理推理纳入基于潜在扩散的V2A生成框架的方法,通过物理驱动音频适配器(Phy-Adapter)实现。该适配器接收由物理参数估计器(PPE)估计的物体级物理参数——PPE使用视觉语言模型(VLM)推断移动物体质量,并通过基于分割的动态3D重建模块恢复其运动轨迹以计算速度。这些物理线索使模型能够合成反映底层物理因素的声音。为评估物理真实性,我们构建了VGG-Impact基准,聚焦于物体-物体相互作用,并引入Audio-Physics Correlation Coefficient(APCC),用于衡量物理属性与听觉属性之间的一致性。全面实验表明,PAVAS在定性和定量评估中均优于现有V2A模型,能够产生物理上合理且感知上连贯的音频。访问 https://physics-aware-video-to-audio-synthesis.github.io 查看演示视频。
引用
@article{arxiv.2512.08282,
title = {PAVAS: Physics-Aware Video-to-Audio Synthesis},
author = {Oh Hyun-Bin and Yuhta Takida and Toshimitsu Uesaka and Tae-Hyun Oh and Yuki Mitsufuji},
journal= {arXiv preprint arXiv:2512.08282},
year = {2026}
}