多模态大语言模型听到了什么?检验文本与声音成分中的推理
音频与语音处理
2024-06-10 v1 计算与语言
声音
摘要
大语言模型(LLMs)展示了卓越的推理能力,特别是在连接思想和遵循逻辑规则解决问题方面。这些模型已经发展到能够适应多种数据模态,包括声音和图像,被称为多模态LLMs(MLLMs),它们能够描述图像或声音记录。先前的工作表明,当MLLMs中的LLM组件被冻结时,音频或视觉编码器用于为声音或图像输入生成描述,从而促进与LLM组件的基于文本的推理。我们有兴趣利用LLM的推理能力来促进分类。在本文中,我们通过一个描述/分类实验证明,音频MLLM在生成音频描述时无法充分利用其LLM的基于文本的推理。我们还考虑了这可能是由于MLLMs分别表示听觉和文本信息,从而切断了从LLM到音频编码器的推理路径。
引用
@article{arxiv.2406.04615,
title = {What do MLLMs hear? Examining reasoning with text and sound components in Multimodal Large Language Models},
author = {Enis Berk Çoban and Michael I. Mandel and Johanna Devaney},
journal= {arXiv preprint arXiv:2406.04615},
year = {2024}
}
备注
9 pages