冻结语言与图像模型的高维交叉模态对齐:用于高效图像描述生成
计算机视觉与模式识别
2026-03-02 v1 人工智能
机器学习
摘要
针对视觉和语言的大型单模态基础模型,它们编码了丰富的语义结构,但对齐它们通常需要计算密集的多模态微调。此类方法依赖于大规模参数更新,资源密集,并且可能扰动预训练的表示。然而,越来越多的证据表明,独立训练的基础模型可能已经显示出潜在的语义兼容性,这反映了它们所建模的数据中共享的结构。这提出了一个根本性的问题:是否可以在不修改模型本身的情况下实现跨模态对齐?本文引入 HDFLIM(HyperDimensional computing with Frozen Language and Image Models),一个在保持预训练视觉和语言模型完全冻结的情况下建立跨模态映射的框架。HDFLIM 将单模态嵌入投影到共享的高维空间,并利用轻量级符号操作——绑定、捆绑和基于相似度的检索——在数据单次遍历中构建交叉模态关联表示。图像描述生成源于高维内存检索,而非迭代的基于梯度的优化。我们表明 HDFLIM 实现的性能相当于端到端视觉语言训练方法,生成的描述在语义上比零样本基线更为 grounding。通过将对齐从参数调优中解耦,我们的结果表明,通过对各自嵌入进行高维编码的符号操作,可以在基础模型之间实现语义映射。更广泛地说,这项工作指向了一种新的范式,用结构化的表示映射而非大规模重新训练来整合冻结模型。我们的实现代码可在 https://github.com/Abhishek-Dalvi410/HDFLIM 查找。
引用
@article{arxiv.2602.23588,
title = {Hyperdimensional Cross-Modal Alignment of Frozen Language and Image Models for Efficient Image Captioning},
author = {Abhishek Dalvi and Vasant Honavar},
journal= {arXiv preprint arXiv:2602.23588},
year = {2026}
}