中文

当规模失败时:通过多步骤感知导向推理缓解 LALMs 音频感知衰减

声音 2026-03-04 v1 人工智能 音频与语音处理

摘要

测试时规模放大在通过扩展推理计算来解决复杂问题方面显示出显著效用。然而,在大型音频语言模型(LALMs)中,存在一种直觉不符的现象:针对结构化推理轨迹进行的后训练相对于针对直接回答进行的后训练仅带来有限甚至为负的收益。为调查此现象,我们引入 CAFE—a 一个旨在精确量化音频推理错误的评估框架。评估结果表明,LALMs 在推理过程中在感知方面存在困难,并遇到了关键瓶颈:随着推理长度的增加,推理性能会因音频感知衰减而受到影响。为此,我们提出了 MPAR2^2(Multi-Step Perception-Aware Reasoning)方法,通过动态感知推理并将复杂问题分解为感知丰富的子问题来缓解此问题。利用强化学习,MPAR2^2 在 CAFE 上的感知性能提升至 63.51%,有效缓解了感知衰减,同时增强了推理能力,在 MMAU 框架上实现了显著的 74.59% 准确率。进一步分析表明,MPAR2^2 增强了 LALMs 对音频输入的注意力,并动态调整推理预算以匹配任务复杂度。

关键词

引用

@article{arxiv.2603.02266,
  title  = {When Scaling Fails: Mitigating Audio Perception Decay of LALMs via Multi-Step Perception-Aware Reasoning},
  author = {Ruixiang Mao and Xiangnan Ma and Dan Chen and Ziming Zhu and Yuan Ge and Aokai Hao and Haishu Zhao and Yifu Huo and Qing Yang and Kaiyan Chang and Xiaoqian Liu and Chenglong Wang and Qiaozhi He and Tong Xiao and Jingbo Zhu},
  journal= {arXiv preprint arXiv:2603.02266},
  year   = {2026}
}

备注

Under Review