解构多模态 in-context 学习:模态不对称性与现代 Transformer 中的电路动力学
计算与语言
2026-05-27 v2 机器学习
摘要
基于 Transformer 的多模态大型语言模型常表现出 in-context 学习 (ICL) 能力。受这一现象的启发,我们提出问题:transformer 如何从 in-context 示例中学习跨模态信息关联呢?我们通过控制实验来探索这一问题,这些实验在小型 transformer 上进行,针对合成分类任务进行训练,使我们能够精确操控数据统计和模型体系结构。我们首先重访现代 transformer 中单模态 ICL 的核心原则。虽然一些既有发现得到复制,但我们发现旋转位置嵌入 (RoPE) 增加了 ICL 的数据复杂性阈值。 extending 到多模态设置后,发现一种根本性的学习不对称:当在来自主要模态的高多样性数据上预训练时, surprisingly 低的次要模态数据复杂性足以使多模态 ICL 出现。机制性分析显示,两种情况下都依赖于一种 induction-style 机制,即从匹配的 in-context exemplar 中复制标签;多模态训练通过跨模态细化和扩展这些电路。我们的发现为理解现代 transformer 中的多模态 ICL 提供了机制性基础,并引入了一个受控 testbed 以进行未来调查。代码可在 https://github.com/YiranHuangIrene/multimodal-icl 获取。
引用
@article{arxiv.2601.20796,
title = {Dissecting Multimodal In-Context Learning: Modality Asymmetries and Circuit Dynamics in modern Transformers},
author = {Yiran Huang and Karsten Roth and Quentin Bouniot and Wenjia Xu and Zeynep Akata},
journal= {arXiv preprint arXiv:2601.20796},
year = {2026}
}
备注
ICML 2026 Spotlight