中文

固定文本编码器的语言-图像对齐

计算机视觉与模式识别 2025-06-05 v1

摘要

目前,建立语言-图像对齐的主导方法是通过对比学习联合预训练文本和图像编码器,例如 CLIP 及其变体。在这项工作中,我们质疑这种昂贵的联合训练是否必要。特别是,我们研究预训练的固定大语言模型(LLM)是否足以作为文本编码器来引导视觉表示学习。即,我们提出通过仅训练图像编码器,从 LLM 中学习固定文本编码器(LIFT)的语言-图像对齐。令人惊讶的是,通过全面的基准测试和消融研究,我们发现这个大幅简化的框架 LIFT 高度有效,在涉及组合理解和长标题的大多数场景中优于 CLIP,同时在计算效率上取得了显著提升。我们的工作迈出了系统探索来自 LLM 的文本嵌入如何引导视觉学习的第一步,并为学习语言对齐的视觉表示提供了一种替代设计选择。

关键词

引用

@article{arxiv.2506.04209,
  title  = {Language-Image Alignment with Fixed Text Encoders},
  author = {Jingfeng Yang and Ziyang Wu and Yue Zhao and Yi Ma},
  journal= {arXiv preprint arXiv:2506.04209},
  year   = {2025}
}