中文

从交互学习中迁移知识

计算机视觉与模式识别 2025-09-24 v1

摘要

当前的视觉基础模型在从视觉语言模型迁移知识时面临根本性限制,尽管 VLM 擅长通过统一的表示空间建模跨模态交互,但现有的 VFM 主要采用面向结果的范式,忽略了潜在的交互过程。这种表示上的差异阻碍了有效的知识迁移,并限制了其在多样化视觉任务中的泛化能力。我们提出了 Learning from Interactions (LFI),一个受认知启发的框架,通过将视觉理解显式建模为交互过程来弥补这一差距。我们的核心洞察是,捕获预训练 VLM 中编码的动态交互模式,能够实现向 VFM 更忠实、更高效的知识迁移。该方法以两项技术创新为中心:交互查询(Interaction Queries,在网络层间维持持久的关系结构)以及源自 VLM 跨模态注意力机制的基于交互的监督。综合实验表明,在多个基准上均有一致的提升,在 TinyImageNet 分类和 COCO 检测/分割上分别实现了 3.3 和 1.6mAP/2.4AP 的绝对增益,且参数开销极小,收敛速度更快。该框架在跨域设置中表现尤为出色,在 PACS 和 VLCS 上分别实现了 2.4 和 9.3 的零样本提升。人类评估进一步证实了其认知一致性,在语义一致性指标上优于面向结果的方法 2.7 倍。

关键词

引用

@article{arxiv.2509.18733,
  title  = {Knowledge Transfer from Interaction Learning},
  author = {Yilin Gao and Kangyi Chen and Zhongxing Peng and Hengjie Lu and Shugong Xu},
  journal= {arXiv preprint arXiv:2509.18733},
  year   = {2025}
}

备注

Accepted by ICCV2025