中文

MCIF:基于科学讲座的人类标注的多模态跨语言指令遵循基准

计算与语言 2026-02-20 v3 人工智能 计算机视觉与模式识别 声音

摘要

近年来,大型语言模型的进展为多模态 LLM (MLLM) 奠定了基础,这些模型统一了文本、语音和视觉。随着这些模型迅速向通用指令遵循跨越多样化和复杂任务的方向发展,关键前沿在于在短输入和长输入上评估其跨语言和多模态能力。然而,现有基准在同时评估这些维度方面不足:它们常常仅限于英文,主要关注单一模态,依赖短格式输入,或缺乏人类标注——阻碍了对模型在不同语言、模态和任务复杂度下的综合性能进行全面评估。为填补这一空白,我们引入MCIF (Multimodal Crosslingual Instruction Following),这是第一个基于科学讲座的人类标注跨语言基准,覆盖 NLP 等领域。MCIF 在跨语言、跨模态情境下评估指令遵循,涵盖不同输入长度和跨度,涉及四大宏任务:识别、翻译、问答和摘要。它覆盖三个核心模态 (语音、视觉和文本) 和四种多样化语言 (英文、德文、意大利文和中文),在所有维度上完全对齐。这一平行设计使我们能够系统评估 MLLM 在不同语言中解释指令以及有效整合多模态上下文信息的能力。我们对 23 个模型进行基准测试和分析,突显不同模态和任务之间的普遍挑战,表明在 MLLM 的未来开发中仍有广泛的提升空间。MCIF 在 CC-BY 4.0 许可下发布,以促进开放研究。

关键词

引用

@article{arxiv.2507.19634,
  title  = {MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks},
  author = {Sara Papi and Maike Züfle and Marco Gaido and Beatrice Savoldi and Danni Liu and Ioannis Douros and Luisa Bentivogli and Jan Niehues},
  journal= {arXiv preprint arXiv:2507.19634},
  year   = {2026}
}

备注

Data available at https://huggingface.co/datasets/FBK-MT/MCIF | Evaluation, outputs, and baselines available at https://github.com/hlt-mt/mcif