中文

GTMA:面向越域视觉语言模型的动态表示优化

计算机视觉与模式识别 2025-12-23 v1 人工智能

摘要

视觉语言模型(VLM)在开放世界应用中表现不佳,常规的越域(OOD)概念会引发跨模态对齐崩溃,严重降低零样本性能。我们发现根本原因在于模态不对称:虽然视觉编码器能够从未见图像中提取判别性特征,但文本编码器受限于固定的离散词汇表,无法合成新的语义锚点。现有方法如 CoOp 或 LoRA 仅提供部分补救,因其仍局限于预训练语义空间。为突破这一瓶颈,我们提出动态表示优化方案,通过引导目标匹配适应框架(GTMA)实现。推理阶段,GTMA 构建与 OOD 图像视觉锚点最佳对齐的连续伪词嵌入,有效绕过词汇限制。优化过程由自适应梯度驱动的表示策略优化算法实现, incorporates 语义正则化以保持合理性与与模型先验知识的兼容性。在 ImageNet-R 和 VISTA-Beyond 基准上实验表明,GTMA 对零样本和少样本 OOD 准确率提升最高可达 15-20 倍,同时保持在分布内概念上的性能。消融研究进一步确认伪词优化的必要性。

关键词

引用

@article{arxiv.2512.18504,
  title  = {GTMA: Dynamic Representation Optimization for OOD Vision-Language Models},
  author = {Jensen Zhang and Ningyuan Liu and Keze Wang},
  journal= {arXiv preprint arXiv:2512.18504},
  year   = {2025}
}

备注

Under submission