JAEGER:模拟物理环境中的 3D 音视频定位与推理
计算机视觉与模式识别
2026-05-29 v3 人工智能
声音
摘要
当前的音视频大语言模型(AV-LLM)主要局限于 2D perception,依赖 RGB 视频和单声道音频。这种设计选择引入了根本性的维度不匹配,无法在复杂 3D 环境中实现可靠的源定位和空间推理。我们通过将 RGB-D 观测与多通道一阶 Ambisonics 集成,扩展 AV-LLM 到 3D 空间,以实现联合空间定位与推理。我们工作的核心贡献是神经强度向量(Neural IV),一种学习的空间音频表示,编码稳健的方向线索以增强到达方向估计,即使在源重叠的恶劣声学场景下也能实现。为促进大规模训练和系统评估,我们提出 SpatialSceneQA,这一来自模拟物理环境的 61k 条指令调优样本基准。广泛的实验表明,我们的方法在多样化的空间感知和推理任务上 consistently 超过 2D 导向的基线,凸显了对物理环境中显式 3D 模型对于推进 AI 至关重要。我们的源代码、预训练模型和数据集均已在 https://github.com/liuzhan22/JAEGER 上提供。
引用
@article{arxiv.2602.18527,
title = {JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments},
author = {Zhan Liu and Changli Tang and Yuxin Wang and Zhiyuan Zhu and Youjun Chen and Yiwen Shao and Tianzi Wang and Lei Ke and Zengrui Jin and Chao Zhang},
journal= {arXiv preprint arXiv:2602.18527},
year = {2026}
}
备注
Accepted to ICML 2026