ABE-CLIP:用于组合图像-文本匹配的无训练属性绑定增强
计算机视觉与模式识别
2025-12-22 v1 信息检索
摘要
对比式语言-图像预训练(CLIP)在 various 多模态任务中取得了显著的性能。然而,它在组合图像-文本匹配中仍面临挑战,尤其是在准确将对象与其相应属性关联时,因为其固有的全局表示往往忽略了属性绑定的细粒度语义。现有方法通常需要额外的训练或广泛的硬性负采样,然而它们经常在针对新组合概念的泛化方面有限,无法从根本上解决全局表示的缺陷。在本文中,我们提出 ABE-CLIP,这是一种 novel 的无训练属性绑定增强方法,用于强化 CLIP 类模型中的属性-对象绑定。具体而言,我们采用语义细化机制来细化文本中对象和属性短语的 token 嵌入,从而缓解属性混淆并提高语义精度。我们进一步引入局部 token-patch 对齐策略,计算细化文本 token 与其最相关图像 patch 之间的相似度得分。通过聚合局部相似度得分,ABE-CLIP 计算最终的图像-文本相似度。在多个数据集上的实验表明,ABE-CLIP 在属性-对象绑定性能方面显著提升,甚至超过需要大量训练的方法。
引用
@article{arxiv.2512.17178,
title = {ABE-CLIP: Training-Free Attribute Binding Enhancement for Compositional Image-Text Matching},
author = {Qi Zhang and Yuxu Chen and Lei Deng and Lili Shen},
journal= {arXiv preprint arXiv:2512.17178},
year = {2025}
}
备注
10 pages, 8 figures