OrdinalCLIP:面向语言引导有序回归的排序提示学习
计算机视觉与模式识别
2022-10-04 v2
摘要
本文提出一种由语言驱动的有序回归范式。现有方法通常将每个秩视为一个类别,并采用一组权重来学习这些概念。这些方法容易过拟合,且由于所学概念主要源自训练集,通常性能不佳。近期如CLIP等大型预训练视觉-语言模型在各种视觉任务上展现出令人印象深刻的性能。本文提出从丰富的语义CLIP潜空间中学习秩概念。具体而言,我们将该任务重新表述为具有对比目标的图像-语言匹配问题,其将标签视为文本并从文本编码器获得每个秩的语言原型。由于CLIP的提示工程极为耗时,我们提出OrdinalCLIP,一种用于使CLIP适应有序回归的可微分提示方法。OrdinalCLIP由可学习上下文词符和可学习秩嵌入组成;可学习秩嵌入通过显式建模数值连续性构建,从而在CLIP空间中产生良序、紧凑的语言原型。一旦学习完成,我们仅保存语言原型并丢弃庞大的语言模型,与线性头对应方法相比实现零额外计算开销。实验结果表明,我们的范式在一般有序回归任务上取得有竞争力的性能,并在年龄估计的少样本和分布偏移设定下获得提升。代码见 https://github.com/xk-huang/OrdinalCLIP。
引用
@article{arxiv.2206.02338,
title = {OrdinalCLIP: Learning Rank Prompts for Language-Guided Ordinal Regression},
author = {Wanhua Li and Xiaoke Huang and Zheng Zhu and Yansong Tang and Xiu Li and Jie Zhou and Jiwen Lu},
journal= {arXiv preprint arXiv:2206.02338},
year = {2022}
}
备注
Accepted by NeurIPS2022. Code is available at https://github.com/xk-huang/OrdinalCLIP