教 CLIP develop a number sense:用于序数回归的 CLIP 学习
计算机视觉与模式识别
2024-08-08 v1 计算与语言
机器学习
摘要
序数回归是计算机视觉领域的基本问题,通常需要针对特定任务进行定制化训练。虽然预训练视觉语言模型(VLM)在 various vision tasks 上表现突出,但其在序数回归方面的潜力受到较少探索。本研究首先检验了 CLIP 在序数回归中的潜力,我们期望该模型能够泛化到不同的序数回归任务和场景。不幸的是,原始 CLIP 在该任务上未能胜任,因为当前 VLM 已知无法捕获诸如数感概念等的组合概念。我们提出一种简单而有效的方法,称为 NumCLIP,用于提高 VLM 的定量理解能力。我们将图像到数值特定文本匹配问题拆分为粗分类和细预测两个阶段。我们将每个数值区间离散化并用常见语言概念表述,以更好地利用 CLIP 中现有的预训练对齐能力。为了考虑序数回归中连续属性的本质,我们提出了一种新型基于细粒度交叉模态排序的正则化损失,专为保持 CLIP 特征空间中的语义与序数对齐而设计。在三个通用序数回归任务上的实验结果表明,NumCLIP 的有效性显著,分别在历史图像 dating 和图像审美评估任务上实现了 10% 和 3.83% 的准确率提升。代码已公开于 https://github.com/xmed-lab/NumCLIP。
引用
@article{arxiv.2408.03574,
title = {Teach CLIP to Develop a Number Sense for Ordinal Regression},
author = {Yao Du and Qiang Zhai and Weihang Dai and Xiaomeng Li},
journal= {arXiv preprint arXiv:2408.03574},
year = {2024}
}
备注
Accepted by ECCV 2024