中文

聆听、暂停、推理:面向音频理解的感知导向混合推理

声音 2026-04-17 v1 多媒体

摘要

最近的大型音频语言模型在音频理解方面展现出惊人的能力。然而,它们常常会出现感知错误,而没有在结构化听觉场景中对模型感知进行 grounding 就无法实现可靠的音频推理。灵感来自听觉场景分析,我们首先引入感知感知问答 (PAQA) 数据集。PAQA 实施了层次化解耦策略,将语音与环境声分离,并区分多个说话者,为训练提供明确的感知推理。基于此,我们提出了 HyPeR,一个两阶段混合感知-推理框架。在阶段 I,我们在 PAQA 上微调模型以感知复杂音频中的声学属性。在阶段 II,我们利用 GRPO 细化模型的内部推敌。我们还引入 PAUSE 标记以促进在声学上模糊阶段的潜在计算,并设计感知一致性奖励以将推理理由与原始音频对齐。实验表明,HyPeR 在各类基准测试中均实现了相对于基础模型的绝对性能提升,性能与大规模模型相当,凸显了感知导向混合推理在稳健和多说话者音频理解方面的有效性。

关键词

引用

@article{arxiv.2604.14806,
  title  = {Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding},
  author = {Jieyi Wang and Yazhe Niu and Dexuan Xu and Zhongyu Wei},
  journal= {arXiv preprint arXiv:2604.14806},
  year   = {2026}
}