中文

语言预训练引发的偏差:通用视觉任务的强大基石

计算机视觉与模式识别 2026-04-06 v2 计算与语言 机器学习

摘要

语言预训练模型中异常参数的比例与视觉预训练模型的异常参数比例存在显著差异,这使得跨模态(语言与视觉)的任务 inherently 更具挑战性。因此,许多先前研究聚焦于跨域迁移,而非尝试搭建语言与视觉模态之间的桥梁,假设语言预训练模型不适用于下游视觉任务,因参数空间差异巨大。我们反驳了这一假设,表明通过添加桥接训练阶段作为模态适应学习器,即可有效地将大型语言模型(LLM)的参数与视觉任务对齐。具体而言,我们提出一种简单且高效的解决方案——随机标签桥接训练,无需人工标注,帮助 LLM 参数适应视觉基础任务。更进一步,我们发现部分桥接训练往往更有优势,因为 LLM 中某些层展现出强大的基础性特性,即使不针对视觉任务进行微调,也能对视觉任务保持有益。这一意想不到的发现开辟了新的路径,使语言预训练参数可直接用于视觉模型中,并凸显了部分桥接训练作为跨模态适应实用路径的潜力。

关键词

引用

@article{arxiv.2604.01833,
  title  = {Language-Pretraining-Induced Bias: A Strong Foundation for General Vision Tasks},
  author = {Yaxin Luo and Zhiqiang Shen},
  journal= {arXiv preprint arXiv:2604.01833},
  year   = {2026}
}

备注

Main manuscript: 13 pages, 9 figures. Appendix: 8 pages, 5 figures. Accepted in Transactions on Machine Learning Research (TMLR) 2026