中文

空间关系的多模态函数向量

人工智能 2025-10-06 v1 机器学习

摘要

大型多模态模型(LMMs)展示了从有限多模态演示中进行上下文学习的惊人能力,但支持此类任务学习的内部机制仍然不透明。在大型语言模型先前工作的基础上,我们表明视觉-语言模型OpenFlamingo-4B中一小部分注意力头负责传递空间关系的表征。这些注意力头的激活——称为函数向量——可以被提取和操纵,以改变LMM在关系任务上的性能。首先,我们使用合成和真实图像数据集,通过因果中介分析识别出对关系预测有强影响的注意力头,并提取多模态函数向量以在推理时提升零样本准确率。我们进一步证明,这些多模态函数向量可以在保持LMM参数冻结的情况下,通过少量训练数据进行微调,从而显著超越上下文学习基线。最后,我们展示关系特定的函数向量可以线性组合,以解决涉及新颖和未训练空间关系的类比问题,这突显了该方法强大的泛化能力。我们的结果表明,LMMs在局部化的内部结构中编码空间关系知识,这些结构可以被系统性地提取和优化,从而推进我们对模型模块化的理解,并增强对LMMs中关系推理的控制。

关键词

引用

@article{arxiv.2510.02528,
  title  = {Multimodal Function Vectors for Spatial Relations},
  author = {Shuhao Fu and Esther Goldberg and Ying Nian Wu and Hongjing Lu},
  journal= {arXiv preprint arXiv:2510.02528},
  year   = {2025}
}