SAR-LM:基于大语言模型的符号音频推理
声音
2025-11-11 v1
摘要
大语言模型(LLMs)在文本和视觉领域已取得显著进展,但其在音频推理方面仍受限。大多数现有方法依赖稠密音频嵌入,解释性差,往往在结构化推理任务中失败。基于标题的方法近期在诸如MMAU等基准测试中引入后提升了性能,但仍依赖稠密嵌入作为输入,模型失败时难以提供深入见解。我们提出SAR-LM(Symbolic Audio Reasoning with Large Language Models),一种基于符号音频推理管道,其在标题基方法框架上构建,通过将音频转换为语音、声音事件和音乐等方面的结构化、人类可读特征。这些符号输入既支持推理,也支持透明的错误分析,使我们能够将错误归因于特定特征。我们在三个基准测试MMAU、MMAR和OmniBench上实现了竞争性的成绩,同时将可解释性作为首要贡献。
引用
@article{arxiv.2511.06483,
title = {SAR-LM: Symbolic Audio Reasoning with Large Language Models},
author = {Termeh Taheri and Yinghao Ma and Emmanouil Benetos},
journal= {arXiv preprint arXiv:2511.06483},
year = {2025}
}