音频多模态大语言模型中交错指令微调对语义推理性能的评估
多媒体
2025-11-05 v1 计算与语言
声音
摘要
标准的多模态大语言模型(MLLAM)训练方法是将非文本信息(如视觉或音频)与文本提示拼接在一起。这种方法可能不鼓励模态的深度融合,限制模型发挥核心语言模型推理能力的潜力。本 work考察了在音频 MLLM中采用交错指令微调的影响,其中音频标记被嵌入提示中。以Listen, Think, and Understand(LTU)模型为测试平台,我们使用全新创建的语义推理基准——Synonym and Hypernym Audio Reasoning Dataset(SHARD),该数据集聚焦于音频语义推理,特别是同义词与上位词识别。我们的发现表明,即使是零样本交错提示,即可提高模型在语义推理任务上的性能;但采用交错训练提示进行少量微调,结果进一步提升,尽管以牺牲MLLM的音频标注能力为代价。
引用
@article{arxiv.2511.02234,
title = {An Evaluation of Interleaved Instruction Tuning on Semantic Reasoning Performance in an Audio MLLM},
author = {Jiawei Liu and Enis Berk Çoban and Zarina Schevchenko and Hao Tang and Zhigang Zhu and Michael I Mandel and Johanna Devaney},
journal= {arXiv preprint arXiv:2511.02234},
year = {2025}
}