中文

LAGO:面向零样本视觉-文本对齐的语言引导自适应目标区域聚焦

计算机视觉与模式识别 2026-05-12 v1 人工智能

摘要

零样本识别旨在无需任何任务特定监督的情况下,通过从一组候选类别中选择最兼容的标签描述来对图像进行分类。然而,在细粒度场景中,相关证据往往存在于局部部件、属性或纹理中,而非整个图像,这使得全图对齐并非最优。近期的局部视觉-文本对齐方法通过将类别描述与多个图像区域进行比较来解决此问题,但它们通常依赖大量随机或冗余的裁剪,增加了推理成本并引入了许多高度冗余或弱相关的候选区域。此外,过早引入语义引导会产生一种错误放大的反馈过程,其中不准确的中间预测会偏置后续的定位并强化后续错误;我们将这种失败模式称为预测循环。我们提出 LAGO(语言引导的自适应目标区域聚焦),一个用于高效且鲁棒的零样本局部视觉-文本对齐框架。LAGO 首先执行类别无关的以目标为中心的候选区域发现,以获得稳定的视觉初始化,然后应用自适应语言引导的细化,其语义引导的强度由中间置信度控制。它进一步通过一种有效的目标-上下文双通道聚合策略,结合了目标级、上下文和全图像证据。大量实验表明,LAGO 在标准零样本基准测试和具有挑战性的分布偏移设置中,始终如一地达到了最先进的性能,同时在推理时所需的候选区域数量大幅减少。

关键词

引用

@article{arxiv.2605.08156,
  title  = {LAGO: Language-Guided Adaptive Object-Region Focus for Zero-Shot Visual-Text Alignment},
  author = {Junyi Hu and Qiji Zhou and Lei Zhang and Yue Zhang},
  journal= {arXiv preprint arXiv:2605.08156},
  year   = {2026}
}

备注

37 pages, 26 figures, including appendix. Preprint