中文

Renaissance:视觉-语言编码器预训练研究

计算机视觉与模式识别 2026-02-26 v2 人工智能 计算与语言 机器学习

摘要

过去几年间,视觉-语言(VL)任务的可用模型呈爆发式增长。不幸的是,该领域仍存在关于设计和训练此类模型最佳实践的若干开放问题。此外,可用于建模的编程工具有限,使得视觉-语言研究比必要的更加困难。本文通过元分析回答若干与视觉-语言编码器预训练相关的问题。为开展这些实验,我们引入了一个名为 Renaissance 的视觉-语言评估框架。在第一组实验中,我们表明通过冻结视觉-语言模型的大部分可以在几乎不损失下游性能的情况下节省大量计算资源。在第二组实验中,我们研究了以视觉模型还是文本模型为基础构建视觉-语言 Transformer 的影响。Renaissance 为创建、训练和评估视觉-语言建模的 Transformer 编码器提供了极大的灵活性。其源代码将在发表时公开。Renaissance 的源代码位于 https://github.com/bsu-slim/renaissance。

关键词

引用

@article{arxiv.2411.06657,
  title  = {Renaissance: Investigating the Pretraining of Vision-Language Encoders},
  author = {Clayton Fields and Casey Kennington},
  journal= {arXiv preprint arXiv:2411.06657},
  year   = {2026}
}

备注

9 pages