中文

GraSP-VL:将长度用作视觉语言表示的语义粒度接口

计算机视觉与模式识别 2026-05-19 v1

摘要

冻结的视觉语言嵌入在多个语义分辨率上包含信号,从对象身份到属性、关系以及完整标题意义,但它们通过固定长度向量接口暴露这些信号。我们研究了嵌入长度是否可以成为可控制的语义访问接口。我们提出了 **GraSP-VL**,该方法在冻结VLM嵌入上学习共享的近正交前缀变换。GraSP-VL 实现了一个 **语义木屃** 接口:短前缀被分配粗糙的语义角色,而较长的前缀逐渐暴露更细致的语言-视觉区别。由于该变换在图像和文本嵌入之间是共享的,并且保留了完整维度的几何结构,前缀行为在不修改原始VLM空间的情况下发生变化。在20,147个COCO/Flickr30K注释池上,GraSP-VL 达到了53.01的楼梯得分和89.76的硬负选择性,同时保持了小于 10610^{-6} 的全空间漂移。它还在SugarCrepe-clean上实现了86.03的对象准确率和11.96的平均外部涌现,同时保持了完整维度的零shot CIFAR-100准确率。这些结果表明,冻结的VLM嵌入可以被重新组织为可截断的语义前缀接口,而不仅仅是压缩。

关键词

引用

@article{arxiv.2605.17727,
  title  = {GraSP-VL: Length as a Semantic Granularity Interface for Vision-Language Representations},
  author = {Zesheng Li and Chengchang Pan and Honggang Qi},
  journal= {arXiv preprint arXiv:2605.17727},
  year   = {2026}
}

备注

Preprint