中文

PhyAVBench:面向物理基础的文本到音视频生成的挑战性音频物理敏感性基准

声音 2026-05-19 v4 人工智能

摘要

文本到音视频 (T2AV) 生成是电影制作和世界建模等应用的核心。然而,当前的模型往往无法产生物理上合理的声学。以往的基准主要关注音视频时间同步,而在很大程度上忽略了对音频物理基础的显式评估,从而限制了对物理上合理的视听生成的研究。为了解决这个问题,我们提出了 PhyAVBench,这是第一个系统评估 T2AV、图像到音视频 (I2AV) 和视频到音频 (V2A) 模型音频物理基础能力的基准。PhyAVBench 提供了 PhyAV-Sound-11K,这是一个包含 25.5 小时、由 184 名参与者收集的 11,605 个可听视频的新数据集,以确保多样性并避免数据泄露。它包含 337 个具有受控物理变化的配对提示组,这些变化驱动声音差异,每个提示组平均以 17 个视频为基础,涵盖 6 个音频物理维度和 41 个细粒度测试点。每个提示对都标注了其声学差异背后的物理因素。重要的是,PhyAVBench 利用配对文本提示来评估这一能力。我们将这种评估范式称为音频物理敏感性测试 (APST),并引入了一个新的指标——对比物理响应分数 (CPRS),用于量化生成视频与其真实世界对应物之间的声学一致性。我们对 17 个 state-of-the-art 模型进行了全面评估。我们的结果显示,即使是领先的商业模型在处理基本音频物理现象时也存在困难,暴露了音视频同步之外的关键差距,并指明了未来的研究方向。我们希望 PhyAVBench 能作为推进物理基础视听生成的基础。提示、真实值和生成的视频样本可在 https://github.com/imxtx/PhyAVBench 获取。

关键词

引用

@article{arxiv.2512.23994,
  title  = {PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation},
  author = {Tianxin Xie and Wentao Lei and Kai Jiang and Guanjie Huang and Pengfei Zhang and Chunhui Zhang and Fengji Ma and Haoyu He and Han Zhang and Jiangshan He and Jinting Wang and Linghan Fang and Lufei Gao and Orkesh Ablet and Peihua Zhang and Ruolin Hu and Shengyu Li and Weilin Lin and Xiaoyang Feng and Xinyue Yang and Yan Rong and Yanyun Wang and Zihang Shao and Zelin Zhao and Chenxing Li and Shan Yang and Wenfu Wang and Meng Yu and Dong Yu and Li Liu},
  journal= {arXiv preprint arXiv:2512.23994},
  year   = {2026}
}

备注

6 major physical dimensions, 41 fine-grained test points, 337 groups of variable-controlled test samples, 11,605 newly recorded videos