中文

通过问答模式实现空间音频理解

声音 2025-07-15 v1 音频与语音处理

摘要

本文提出了一种新型框架,通过问答 (QA) 范式实现一阶 ambisonic (FOA) 信号的空间音频理解,旨在将声事件定位与检测 (SELD) 的范围扩展到空间场景理解与推理。首先,我们采用基于规则的方法策划并发布细粒度时空文本描述,用于 STARSS23 数据集,并进一步利用大型语言模型 (LLM) 基于重述的方式提升语言多样性。我们还引入与 STARSS23 场景对齐的 QA 数据集,涵盖各种方面,如事件存在、定位、空间和时间关系。为增加语言多样性,我们再次利用 LLM 为每个问题生成多个重述。最后,我们开发了一个基线空间音频 QA 模型,该模型以 FOA 信号和自然语言问题为输入,提供有关各种事件、时间和空间关系的答案,作为分类任务形式化。尽管仅使用场景级问答监督训练,本模型的性能甚至可以与完全监督的声事件定位与检测模型相当,后者使用的是帧级时空注释。结果凸显了语言引导方法在空间音频理解中的潜力,并为将语言监督整合到空间场景分析中开辟了新方向。

关键词

引用

@article{arxiv.2507.09195,
  title  = {Towards Spatial Audio Understanding via Question Answering},
  author = {Parthasaarathy Sudarsanam and Archontis Politis},
  journal= {arXiv preprint arXiv:2507.09195},
  year   = {2025}
}