HiMo-CLIP:在视觉-语言对齐中建模语义层次与单调性
计算机视觉与模式识别
2025-11-11 v1 计算与语言
摘要
对比视觉-语言模型(如CLIP)通过在共享嵌入空间中对齐图像和文本表示,在图像-文本检索任务中取得了令人瞩目的成果。然而,这些模型通常将文本视为扁平序列,限制了它们处理复杂、组合性及长文本描述的能力。具体而言,它们未能捕捉语言的两个基本属性:语义层次性,它反映了文本的多层组合结构;以及语义单调性,即更丰富的描述应导致与视觉内容更强的对齐。为解决这些局限性,我们提出了HiMo-CLIP,一个无需修改编码器架构即可增强CLIP风格模型的表示级框架。HiMo-CLIP引入了两个关键组件:一个层次分解(HiDe)模块,通过批内PCA从长文本中提取潜在语义成分,实现跨不同语义粒度的灵活、批次感知对齐;以及一个单调性感知对比损失(MoLo),它联合对齐全局和组件级表示,鼓励模型内化语义顺序和对齐强度作为文本完整性的函数。这些组件协同工作,产生结构化、认知对齐的跨模态表示。在多个图像-文本检索基准上的实验表明,HiMo-CLIP持续优于强基线,特别是在长文本或组合性描述下。代码可在 https://github.com/UnicomAI/HiMo-CLIP 获取。
引用
@article{arxiv.2511.06653,
title = {HiMo-CLIP: Modeling Semantic Hierarchy and Monotonicity in Vision-Language Alignment},
author = {Ruijia Wu and Ping Chen and Fei Shen and Shaoan Zhao and Qiang Hui and Huanlin Gao and Ting Lu and Zhaoxiang Liu and Fang Zhao and Kai Wang and Shiguo Lian},
journal= {arXiv preprint arXiv:2511.06653},
year = {2025}
}
备注
Accepted by AAAI 2026 as an Oral Presentation (13 pages, 7 figures, 7 tables)