SAKURA:基于语音和音频信息的大型音频语言模型多跳推理
音频与语音处理
2025-08-26 v3 计算与语言
声音
摘要
大型音频语言模型(LALMs)将多模态理解能力扩展至语音、音频等领域。虽然其在语音和音频处理任务上的性能已得到广泛研究,但其推理能力仍受到 insufficient 探索。尤其是其多跳推理能力——即能够回忆和整合多个事实的能力——缺乏系统化的评估。现有基准测试侧重于通用语音和音频处理任务、对话能力和公平性,却忽略了这一方面。为弥合这一差距,我们引入了 SAKURA,一个用于评估 LALMs 基于语音和音频信息的多跳推理的基准测试。结果表明,LALMs 在进行多跳推理时难以整合语音/音频表征,即使它们正确提取了相关信息,也是如此,这凸显了多模态推理中的一个根本性挑战。我们的发现揭示了 LALMs 的一个关键局限,为未来的研究提供了见解和资源。
引用
@article{arxiv.2505.13237,
title = {SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information},
author = {Chih-Kai Yang and Neo Ho and Yen-Ting Piao and Hung-yi Lee},
journal= {arXiv preprint arXiv:2505.13237},
year = {2025}
}
备注
Accepted to Interspeech 2025 (Oral). Update acknowledgement in this version. Project page: https://github.com/ckyang1124/SAKURA