中文

基于超bolic视觉语言模型中不确定性引导的组成对齐与部分-整体语义代表性

计算机视觉与模式识别 2026-03-25 v2 人工智能

摘要

虽然视觉语言模型(VLMs)取得了显著的性能,但其欧几里得嵌入在捕捉部分-整体或上下-子结构关系方面受限,常面临多对象组合场景的挑战。超bolic VLMs 通过更好地保留层次结构和建模部分-整体关系(即整体场景及其部分图像)来缓解这一问题,但现有方法未能建模每个部分对整体的语义代表性水平不同。我们提出UNcertainty-guided Compositional Hyperbolic Alignment(UNCHA)以增强超bolic VLMs。UNCHA 利用超bolic不确定性建模部分-整体语义代表性,为更具代表性的部分分配较低不确定性,为较不具代表性的部分分配较高不确定性以服务于整体场景。该代表性随不确定性引导的权重纳入对比目标。最后,通过以熵为基础术语正则化的包含损失进一步校准不确定性。通过所提损失,UNCHA 学习出更精确的部分-整体排序嵌入,捕捉图像中潜在的组成结构,并提高对复杂多对象场景的理解能力。UNCHA 在零样本分类、检索和多标签分类基准测试中实现了最先进的性能。我们的代码和模型可在 https://github.com/jeeit17/UNCHA.git 获取。

关键词

引用

@article{arxiv.2603.22042,
  title  = {Uncertainty-guided Compositional Alignment with Part-to-Whole Semantic Representativeness in Hyperbolic Vision-Language Models},
  author = {Hayeon Kim and Ji Ha Jang and Junghun James Kim and Se Young Chun},
  journal= {arXiv preprint arXiv:2603.22042},
  year   = {2026}
}

备注

Accepted to CVPR 2026