音视频世界模型:视听感知的多感官想象
多媒体
2026-03-11 v2 计算机视觉与模式识别
声音
摘要
世界模型模拟环境动力学,以便代理人规划和推理未来状态。虽然已有方法主要聚焦于视觉观察,但现实世界的感知本质上涉及多种感官模态。音频提供关键的空间和时间线索,如声源定位和声学场景属性,但其集成到世界模型中仍 largely 未探索。目前尚无先前工作正式定义音视频世界模型的构成,或如何在精确动作控制下联合捕获双耳空间音频和视觉动力学。本文提出首个音视频世界模型(AVWM)的正式框架,将多模态环境仿真表述为部分可观测马尔可夫决策过程,包含同步的音视频观察。为解决缺乏合适训练数据的瓶颈,我们构建 AVW-4k 数据集,包含 30 小时双耳音视频轨迹,覆盖 76 个室内环境并带有动作标注。我们提出 AV-CDiT,一种音视频条件扩散变换器,具备新颖的模态专家架构平衡视觉与听觉学习,通过三阶段训练策略实现有效的多模态集成。广泛实验表明,AV-CDiT 在视觉和听觉模态上实现高保真多模态预测。进一步验证了其在连续音视频导航任务中的实际用途,AVWM 显著提升了代理人的性能。
引用
@article{arxiv.2512.00883,
title = {Audio-Visual World Models: Towards Multisensory Imagination in Sight and Sound},
author = {Jiahua Wang and Leqi Zheng and Jialong Wu and Yaoxin Mao},
journal= {arXiv preprint arXiv:2512.00883},
year = {2026}
}