PHyCLIP:$\ell_1$-双曲因子乘积统一视觉-语言表示学习中的层次性与组合性
计算机视觉与模式识别
2026-03-03 v2 机器学习
摘要
视觉-语言模型在从大规模视觉场景与语言描述对中学习多模态表示方面取得了显著成功。然而,它们仍然难以同时表达两种不同的语义结构:概念族内部的层次性(例如,狗 哺乳动物 动物)以及不同概念族之间的组合性(例如,"一辆车里的狗" 狗、车)。近期工作通过采用双曲空间来解决这一挑战,该空间能高效捕捉类树层次结构,但其在表示组合性方面的适用性仍不明确。为解决这一困境,我们提出 PHyCLIP,它在双曲因子的笛卡尔积上采用 -乘积度量。通过我们的设计,族内层次性在单个双曲因子内部涌现,而跨族组合性由 -乘积度量捕获,类似于布尔代数。在零样本分类、检索、层次分类和组合理解任务上的实验表明,PHyCLIP 优于现有的单空间方法,并在嵌入空间中提供了更具可解释性的结构。
引用
@article{arxiv.2510.08919,
title = {PHyCLIP: $\ell_1$-Product of Hyperbolic Factors Unifies Hierarchy and Compositionality in Vision-Language Representation Learning},
author = {Daiki Yoshikawa and Takashi Matsubara},
journal= {arXiv preprint arXiv:2510.08919},
year = {2026}
}
备注
24 pages. Codes are available at https://github.com/tksmatsubara/PHyCLIP