中文

ORION:通用视觉语言模型适配的正交文本编码

计算机视觉与模式识别 2026-03-30 v2

摘要

视觉语言模型(VLMs)在 diverse 任务上已显示出惊人的泛化能力,但其性能仍受限于用于表示类别的文本原型的质量和几何。标准零样分类器源自冻结文本编码器和手工提示,可能产生相关或弱分离的嵌入,限制任务特定的可区分性。我们引入ORION,一种文本编码器微调框架,通过仅使用类别名称改进预训练 VLMs 的性能。该方法通过低秩适配优化一种新型损失,集成两个术语:一个促进给定任务类别文本表示之间的两两正交,另一个惩罚偏离初始类原型的程度。此外,我们提供了正交惩罚的概率解释,将其与通过胡氏定理连接到一般最大似然估计(MLE)原则。我们在 11 个基准测试和三个大型 VLM 主干模型上报告了广泛实验,表明精炼后的文本嵌入可成为标准 CLIP 原型的强大替代品。作为可插入模块叠加在各种先进方法之上,以及在不同的预测设置(零样、少样和测试时适应)中,ORION 在性能上一致且显著地提高。

关键词

引用

@article{arxiv.2602.19530,
  title  = {ORION: ORthonormal Text Encoding for Universal VLM AdaptatION},
  author = {Omprakash Chakraborty and Jose Dolz and Ismail Ben Ayed},
  journal= {arXiv preprint arXiv:2602.19530},
  year   = {2026}
}