TACO:通过任务映射引导的序列配置提升多模态情境学习
计算与语言
2025-10-22 v4 计算机视觉与模式识别
摘要
多模态情境学习(Multimodal in-context learning, ICL)已成为一种关键机制,用以发挥大型视觉语言模型(LVLMs)的能力。然而,其有效性对输入 ICL 序列的质量高度敏感,尤其是针对涉及复杂推理或开放式生成的任务。一个主要局限是我们对 LVLMs 在推理期间实际如何利用这些序列缺乏充分了解。为弥合这一差距,本文通过任务映射的视角系统性地解释多模态 ICL,这揭示了局部和全局关系如何在演示项之间指导模型推理。基于这一洞察,我们提出 TACO,一个轻量级 transformer-based 模型,配备任务感知注意力,可动态配置 ICL 序列。通过将任务映射信号注入自回归解码过程,TACO 在序列构建和任务推理之间创建双向协同。在五个 LVLMs 和九个数据集上的实验表明,TACO 在多样化 ICL 任务中 consistently 超越基线。这结果将任务映射定位为解释和改进多模态 ICL 的一种新型且有价值的视角。
引用
@article{arxiv.2505.17098,
title = {TACO: Enhancing Multimodal In-context Learning via Task Mapping-Guided Sequence Configuration},
author = {Yanshu Li and Jianjiang Yang and Tian Yun and Pinyuan Feng and Jinfa Huang and Ruixiang Tang},
journal= {arXiv preprint arXiv:2505.17098},
year = {2025}
}
备注
EMNLP2025 Main, 28 pages, 11 figures, 19 tables