中文

Omni-CLST:用于音频问答的误差感知课程学习与引导式选择性思维链

声音 2025-09-19 v3 人工智能 音频与语音处理

摘要

随着大型音频语言模型(LALMs)的快速发展,音频问答(AQA)已成为一项具有挑战性的任务,需要细粒度的音频理解和复杂的推理。虽然当前方法主要依赖于通过描述或推理轨迹构建新数据集,但现有的高质量 AQA 数据仍未得到充分利用。为了解决这个问题,我们提出了 Omni-CLST,一个具有引导式选择性思维链的误差感知课程学习框架。该框架通过两个关键策略高效利用了现有高质量数据集:一个按难度组织样本的误差感知课程,以及一个将推理集中在困难案例上的引导式思维丢弃机制。实验表明,Omni-CLST 在 MMAU-mini 上达到 73.80%,在 MMAR 上达到 64.30% 的新 SOTA,证明了在多模态音频语言理解中具有稳健的泛化能力。

关键词

引用

@article{arxiv.2509.12275,
  title  = {Omni-CLST: Error-aware Curriculum Learning with guided Selective chain-of-Thought for audio question answering},
  author = {Jinghua Zhao and Hang Su and Lichun Fan and Zhenbo Luo and Hui Wang and Haoqin Sun and Yong Qin},
  journal= {arXiv preprint arXiv:2509.12275},
  year   = {2025}
}

备注

5 pages, 1 figure, 2 tables submitted to icassp, under prereview