AQA-TTRL:基于测试时强化学习的音频问答自适应框架
音频与语音处理
2026-01-23 v2
摘要
大型音频语言模型 (LALM) 在音频理解方面展现出惊人的通用能力,但一旦部署后便固定不变,无法通过新实际音频数据进行提升。鉴于传统监督微调成本高昂,我们引入了一个用于测试时音频理解的新框架AQA-TTRL,其中LALM仅凭无标签测试数据即可在运行中自我演化。它首先通过多数投票生成预测的伪标签,然后通过强化学习优化模型。为处理这些自生成标签中固有的噪声,我们引入基于置信度的加权方法以调整训练信号。此外,多尝试采样操作可缓解优势收敛并稳定训练。在MMAU(test-mini/test)、MMAR和MMSU基准上,AQA-TTRL对Qwen2.5-Omni 7B模型实现了4.42%的显著提升,对3B模型实现了11.04%的显著提升。值得注意的是,适配后的3B模型在推理效率上持续超过未适配的7B模型,凸显了在音频理解中探索的测试时适应性的有效性。
引用
@article{arxiv.2510.05478,
title = {AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning},
author = {Haoyu Zhang and Jiaxian Guo and Yusuke Iwasawa and Yutaka Matsuo},
journal= {arXiv preprint arXiv:2510.05478},
year = {2026}
}