排序学习遇见语言:增强语言驱动的顺序对齐用于序数分类
计算机视觉与模式识别
2023-10-24 v3 人工智能
摘要
我们提出一种用于序数分类的新型语言驱动顺序对齐方法。序数分类中的标签包含额外顺序关系,仅依赖训练数据时易过拟合。预训练视觉-语言模型的近期进展启发我们,通过将原始任务转化为视觉-语言对齐任务,来利用人类语言中的丰富序数先验。据此,我们提出L2RCLIP,从两个角度充分利用语言先验。首先,我们引入称为RankFormer的互补提示微调技术,旨在增强原始排序提示的顺序关系。它在词嵌入空间中使用token级注意力与残差式提示混合。其次,为进一步融入语言先验,我们重访朴素交叉熵损失的近似界优化,并在跨模态嵌入空间中重构之。由此,我们提出跨模态序数成对损失以精炼CLIP特征空间,其中文本与图像同时保持语义对齐与顺序对齐。在包括人脸年龄估计、历史彩色图像(HCI)分类和美学评估的三个序数分类任务上的大量实验展示了其良好性能。代码见https://github.com/raywang335/L2RCLIP。
引用
@article{arxiv.2306.13856,
title = {Learning-to-Rank Meets Language: Boosting Language-Driven Ordering Alignment for Ordinal Classification},
author = {Rui Wang and Peipei Li and Huaibo Huang and Chunshui Cao and Ran He and Zhaofeng He},
journal= {arXiv preprint arXiv:2306.13856},
year = {2023}
}
备注
Accepted by NeurIPS 2023