中文

基于幂集对齐的 PowerCLIP:对比预训练框架

计算机视觉与模式识别 2026-04-21 v5

摘要

对比式视觉语言预训练框架如 CLIP 在各种视觉语言任务上展现出惊人的零样性能。近期研究表明,将单个文本标记与特定图像块或区域对齐可增强细粒度的组合理解。然而,捕获跨多个图像区域的组合语义仍具挑战。为此,我们提出了 PowerCLIP,一种通过幂集对齐增强的新型对比预训练框架,通过最小化幂集中图像区域与文本解析树之间的损失,彻底优化区域到短语的对齐。由于朴素的幂集构建因区域子集的组合爆炸导致计算成本呈指数增长,本文引入高效非线性聚合器 (non-linear aggregators, NLAs),将复杂度从 O(2^M) 降低至 O(M) (M 为区域数量),同时以任意精度近似精确损失值。广泛的实验表明,PowerCLIP 在零样本分类和检索任务中超越当前最先进的方法,凸显了其组合性和鲁棒性。代码已公开于 https://github.com/Masakichi210/PowerCLIP。

关键词

引用

@article{arxiv.2511.23170,
  title  = {PowerCLIP: Powerset Alignment for Contrastive Pre-Training},
  author = {Masaki Kawamura and Nakamasa Inoue and Rintaro Yanagi and Hirokatsu Kataoka and Rio Yokota},
  journal= {arXiv preprint arXiv:2511.23170},
  year   = {2026}
}