多模态基础模型中音频推理的综述
音频与语音处理
2026-05-21 v1
摘要
推理已成为现代基础模型的核心能力,但在音频模态上的发展仍受限。音频与文本和视觉模态存在不同挑战:其连续性、时序密度以及在多个时间尺度上包含的语言信息、非语言信息和环境信息。因此,音频推理模型必须将声学信号与大型语言模型的离散语义空间对齐,同时仍需保留可靠推断所需的细粒度信息。进展还受到三个主要障碍的限制: genuinely audio-grounded 推理数据的稀缺、shortcut learning(捷径学习)与模态幻觉、以及推理深度与 spoken interaction(语音交互)中的实时延迟之间的张力。本文present了首个专门针对音频推理的综述。我们提供了统一的表述,区分直接预测建模与推理增强生成,审查了音频推理模型的架构与训练基础,系统组织了近期在 Audio-to-Text、Audio-to-Speech、Audio-Visual Reasoning 和 Agentic Audio Reasoning 中的最新进展。我们进一步检阅了诸如 Chain-of-Thought 提示、监督微调、强化学习以及面向语音交互的时延感知方法等新兴范式,并讨论评估实践、开放挑战及未来方向。我们的目标是为开发稳健、高效且原生基于音频的推理系统提供清晰的路线图。
引用
@article{arxiv.2605.21008,
title = {A Survey of Audio Reasoning in Multimodal Foundation Models},
author = {Zhihan Guo and Wenqian Cui and Guan-Ting Lin and Daxin Tan and Jingyao Li and Qiyong Zheng and Dingdong Wang and Jing Xiong and Han Shi and Jiaya Jia and Irwin King},
journal= {arXiv preprint arXiv:2605.21008},
year = {2026}
}