中文

音频多模态大语言模型中交错指令微调对语义推理性能的评估

多媒体 2025-11-05 v1 计算与语言 声音

摘要

标准的多模态大语言模型(MLLAM)训练方法是将非文本信息(如视觉或音频)与文本提示拼接在一起。这种方法可能不鼓励模态的深度融合,限制模型发挥核心语言模型推理能力的潜力。本 work考察了在音频 MLLM中采用交错指令微调的影响,其中音频标记被嵌入提示中。以Listen, Think, and Understand(LTU)模型为测试平台,我们使用全新创建的语义推理基准——Synonym and Hypernym Audio Reasoning Dataset(SHARD),该数据集聚焦于音频语义推理,特别是同义词与上位词识别。我们的发现表明,即使是零样本交错提示,即可提高模型在语义推理任务上的性能;但采用交错训练提示进行少量微调,结果进一步提升,尽管以牺牲MLLM的音频标注能力为代价。

关键词

引用

@article{arxiv.2511.02234,
  title  = {An Evaluation of Interleaved Instruction Tuning on Semantic Reasoning Performance in an Audio MLLM},
  author = {Jiawei Liu and Enis Berk Çoban and Zarina Schevchenko and Hao Tang and Zhigang Zhu and Michael I Mandel and Johanna Devaney},
  journal= {arXiv preprint arXiv:2511.02234},
  year   = {2025}
}