中文

动态源运动上的空间音频问答与推理

声音 2026-02-19 v1 人工智能

摘要

空间音频理解旨在使机器能够解释复杂的听觉场景,尤其是在声源随时间移动的情况下。本文聚焦于运动推理的空间音频问答(Spatial AQA),要求模型直接从立体声中推断物体运动、位置和方向变化。首先,我们引入一种以运动为中心的空间音频数据增强框架,从独立的单声道音频事件综合出多样化的运动模式,实现可控且可扩展的训练数据生成。其次,我们提出一种带有思考模式的端到端多模态微调方法,使音频语言模型在预测答案前能够生成明确的中间推理步骤。最后,我们研究了查询条件声源分离的预处理影响,并比较了三种推理模式:无掩码、音频 grounding 模型(AGM)以及 ground-truth 掩码。我们的结果表明,推理放大了声源分离的优势,当问题中只有单个事件时,思考模式可实现+5.1%的显著提升。这些发现凸显了运动建模、推理与分离质量之间的相互作用,为推进空间音频理解提供了新的见解。

关键词

引用

@article{arxiv.2602.16334,
  title  = {Spatial Audio Question Answering and Reasoning on Dynamic Source Movements},
  author = {Arvind Krishna Sridhar and Yinyi Guo and Erik Visser},
  journal= {arXiv preprint arXiv:2602.16334},
  year   = {2026}
}