中文

(视觉)语言模型中的跨模态分类泛化

计算与语言 2026-04-23 v2 人工智能

摘要

我们研究了语言模型 (LM) 从表面形式学习的语义表征与从更具 grounding 证据学习的语义表征之间的相互作用。我们聚焦于一种场景:输入的部分来自不同模态——在本研究中,作为视觉-语言模型 (VLM),预训练的 LM 与预训练的图像编码器对齐。作为案例研究,我们关注预测图像所表示对象的最上位类 (hypernym) 的任务。我们在 VLM 设置下保持图像编码器和 LM 冻结,仅学习中间映射。我们逐步剥夺 VLM 对最上位类的显式证据,测试 LM 是否能够从中恢复该知识。我们发现,我们研究的 LM 能够恢复这种知识,即使在本研究最极端版本中(模型在训练时未收到最上位类的任何证据),亦可实现。额外实验表明,这种跨模态分类泛化仅当反事实图像-标签映射数据在每个类别内具有高视觉相似性时,才会持续存在。综上,这些发现表明,跨模态泛化在 LM 中源于外部非语言输入的一致性以及来自语言线索的知识。

关键词

引用

@article{arxiv.2603.07474,
  title  = {Cross-Modal Taxonomic Generalization in (Vision-) Language Models},
  author = {Tianyang Xu and Marcelo Sandoval-Castaneda and Karen Livescu and Greg Shakhnarovich and Kanishka Misra},
  journal= {arXiv preprint arXiv:2603.07474},
  year   = {2026}
}

备注

ACL 2026 (main conference)