MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models
Abstract
While multi-audio understanding is critical for large audio-language models (LALMs), it remains underexplored. We introduce MUGEN, a comprehensive benchmark evaluating this capability across speech, general audio, and music. Our experiments reveal consistent weaknesses in multi-audio settings, and performance degrades sharply as the number of concurrent audio inputs increases, identifying input scaling as a fundamental bottleneck. We further investigate training-free strategies and observe that Audio-Permutational Self-Consistency, which diversifies the order of audio candidates, helps models form more robust aggregated predictions, yielding up to 6.28% accuracy gains. Combining this permutation strategy with Chain-of-Thought further improves performance to 6.74%. These results expose blind spots in current LALMs and provide a foundation for evaluating complex auditory comprehension.
Cite
@article{arxiv.2603.09714,
title = {MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models},
author = {Chih-Kai Yang and Yun-Shao Tsai and Yu-Kai Guo and Ping-Le Tsai and Yen-Ting Piao and Hung-Wei Chen and Ting-Lin Hsiao and Yun-Man Hsu and Ke-Han Lu and Hung-yi Lee},
journal= {arXiv preprint arXiv:2603.09714},
year = {2026}
}
Comments
6 pages, 3 figures, 3 tables. Dataset: https://huggingface.co/Multi-Audio-Grounding