ARGENT:自适应层次化图像-文本表示
计算机视觉与模式识别
2026-03-25 v1 机器学习
摘要
大规模视觉-语言模型(VLMs)如 CLIP 学习了强大的语义表示,但在欧几里得空间中运作,无法捕捉视觉和语言概念的固有层次结构。双曲几何因其指数体积增长,为以低失真嵌入此类层次结构提供了原则性替代方案。然而,现有的双曲 VLM 使用不稳定的蕴含损失:当父嵌入向原点收缩时,其蕴含锥向半空间扩展,导致灾难性锥坍缩,破坏了预期的层次结构。此外,这些模型的层次化评估仍不可靠,主要基于检索和相关性指标,且容易受分类法依赖和模糊负样本的影响。为解决这些局限性,我们提出了一种自适应蕴含损失 paired with 范数正则化,以防止锥坍缩而无需启发式孔径裁剪。我们进一步引入了一种基于角度的概率蕴含协议(PEP),用于评估层次化理解,以 AUC-ROC 和平均精度评分。本文提出了一种更强的双曲 VLM 基线 ARGENT(Adaptive hieRarchical imaGe-tExt represeNTation)。ARGENT 在图像分类、文本到图像检索和所提出的层次化指标上分别将 SOTA 双曲 VLM 提升了 0.7、1.1 和 0.8 个绝对百分点。
引用
@article{arxiv.2603.23311,
title = {ARGENT: Adaptive Hierarchical Image-Text Representations},
author = {Chuong Huynh and Hossein Souri and Abhinav Kumar and Vitali Petsiuk and Deen Dayal Mohan and Suren Kumar},
journal= {arXiv preprint arXiv:2603.23311},
year = {2026}
}