中文

AC/DC: 基于LLM的音频理解通过对话延续

音频与语音处理 2025-06-13 v1 计算与语言 声音

摘要

我们提出了一种指令遵循的音频理解模型,利用大型语言模型(LLM)的对话延续能力。该方法不是直接在训练数据中生成目标标题,而是训练模型产生响应,仿佛输入标题触发了一段对话。这种对话延续训练缓解了标题变化问题。学会延续对话能够有效捕捉标题的深层含义,而不仅仅是其表面词汇。因此,我们的模型即使仅基于音频标题数据集训练,也能实现零样本指令遵循能力,无需多任务指令微调。在AudioCaps、WavCaps和Clotho数据集上结合AudioBench音频场景问答测试的实验证明了我们的模型遵循各种未见指令的能力。

关键词

引用

@article{arxiv.2506.10312,
  title  = {AC/DC: LLM-based Audio Comprehension via Dialogue Continuation},
  author = {Yusuke Fujita and Tomoya Mizumoto and Atsushi Kojima and Lianbo Liu and Yui Sudo},
  journal= {arXiv preprint arXiv:2506.10312},
  year   = {2025}
}

备注

Accepted to Interspeech 2025