ExpAlign:基于期望引导的开放词汇 grounding 的视觉语言对齐
计算机视觉与模式识别
2026-02-02 v1
摘要
开放词汇 grounding 需要在弱监督条件下实现精准的视觉语言对齐,但现有方法要么依赖缺乏细粒度表达力的全局句子嵌入,要么引入带显式监督或重型跨注意力设计的 token 级对齐。我们提出 ExpAlign,一个建立在原则化多实例学习公式下的视觉语言对齐框架。ExpAlign 引入期望对齐头部(Expectation Alignment Head),通过注意力机制对 token-region 相似度进行软型 MIL 汇聚,实现无需额外标注的隐式 token 与 instance 选择。为进一步稳定对齐学习,我们开发了基于能量的多尺度一致性正则化方案,包括 Top-K 多正例对比目标和源自拉格朗日约束自由能最小化的几何感知一致性目标。大量实验表明,ExpAlign 在开放词汇检测和零样体实例分割中均能稳定提升,尤其在长尾类别上表现突出。在可比模型规模下,ExpAlign 在 LVIS minival 数据集上实现 36.2 AP,超越其他最先进方法,同时保持轻量级且高效的推理性能。
引用
@article{arxiv.2601.22666,
title = {ExpAlign: Expectation-Guided Vision-Language Alignment for Open-Vocabulary Grounding},
author = {Junyi Hu and Tian Bai and Fengyi Wu and Wenyan Li and Zhenming Peng and Yi Zhang},
journal= {arXiv preprint arXiv:2601.22666},
year = {2026}
}
备注
20 pages, 6 figures