多模态任务干扰:历史-目标不匹配在多模态大语言模型中的基准测试与分析
计算与语言
2026-03-20 v1
摘要
任务干扰——即单次对话中任务切换导致的性能下降——目前仅在文本-only 环境中得到研究,尽管多模态对话系统日益普及。我们介绍了一个用于评估该现象在多模态大语言模型(LLM)中的表现的基准测试,涵盖文本和视觉六个任务,系统性地沿着三个轴线变异 history-target:模态不匹配、推理不匹配和答案格式不匹配。开放权重和专有模型上的实验揭示,任务干扰是高度方向性的:从文本-only 切换到基于图像的目标会导致严重的性能下降,而相反的转换几乎不产生性能退化。当不匹配在多个维度上同时存在时,干扰效应进一步放大;干扰主要来自模态差异,其次是答案格式,而推理要求的变化导致最小的性能退化。
引用
@article{arxiv.2603.18425,
title = {Multimodal Task Interference: A Benchmark and Analysis of History-Target Mismatch in Multimodal LLMs},
author = {Masayuki Kawarada and Tatsuya Ishigaki and Hiroya Takamura},
journal= {arXiv preprint arXiv:2603.18425},
year = {2026}
}