中文

全局与局部蕴涵学习用于自然世界图像

计算机视觉与模式识别 2025-06-27 v1

摘要

在视觉语言模型中学习数据的层次结构是一个重要挑战。先前的工作尝试通过采用蕴涵学习来解决这一挑战。然而,这些方法未能明确建模蕴涵的传递性,这一特性在表示空间中建立了顺序与语义之间的关系。在本工作中,我们引入了径向跨模态嵌入 (Radial Cross-Modal Embeddings, RCME),一个能够显式建模传递性强制蕴涵的框架。我们提出的框架优化了视觉语言模型中概念的部分秩序。通过利用我们的框架,我们开发了一种能够代表树状生命谱系层次结构的层次化视觉语言基础模型。我们的实验在层次化物种分类和层次化检索任务上表明,我们的模型相对于现有的状态-of-the-art模型表现出增强的性能。我们的代码和模型已开源于 https://vishu26.github.io/RCME/index.html。

关键词

引用

@article{arxiv.2506.21476,
  title  = {Global and Local Entailment Learning for Natural World Imagery},
  author = {Srikumar Sastry and Aayush Dhakal and Eric Xing and Subash Khanal and Nathan Jacobs},
  journal= {arXiv preprint arXiv:2506.21476},
  year   = {2025}
}

备注

Accepted at ICCV 2025