CILF-CIAE:用于纠正逆向年龄估计的 CLIP 驱动图像-语言融合
计算机视觉与模式识别
2024-09-04 v3 人工智能
摘要
年龄估计任务旨在通过分析图像中的面部特征来预测个体的年龄。年龄估计的发展可以提高各种应用(例如年龄验证和安全访问控制等)的效率和准确性。近年来,对比语言-图像预训练(CLIP)已被广泛应用于各种多模态任务中,并在年龄估计领域取得了一些进展。然而,现有的基于 CLIP 的年龄估计方法在对图像进行全局建模时需要较高的内存消耗(二次复杂度),并且缺乏误差反馈机制来向模型提示年龄预测结果的质量。为了解决上述问题,我们提出了一种用于纠正逆向年龄估计的 CLIP 驱动图像-语言融合(CILF-CIAE)。具体而言,我们首先引入 CLIP 模型分别提取图像特征和文本语义信息,并将它们映射到一个高度语义对齐的高维特征空间中。接下来,我们设计了一种新的 Transformer 架构(即 FourierFormer)来实现图像的通道演化与空间交互,并融合图像与文本语义信息。与注意力机制的二次复杂度相比,所提出的 Fourierformer 具有线性对数复杂度。为了进一步缩小图像与文本特征之间的语义鸿沟,我们利用一个高效的对比多模态学习模块,通过用于图像-文本匹配的对比损失来监督 FourierFormer 的多模态融合过程,从而改善不同模态之间的交互效果。最后,我们引入了可逆年龄估计,利用端到端的误差反馈来降低年龄预测的错误率。通过在多个数据集上的大量实验,CILF-CIAE 取得了更好的年龄预测结果。
引用
@article{arxiv.2312.01758,
title = {CILF-CIAE: CLIP-driven Image-Language Fusion for Correcting Inverse Age Estimation},
author = {Yuntao Shou and Wei Ai and Tao Meng and Nan Yin and Keqin Li},
journal= {arXiv preprint arXiv:2312.01758},
year = {2024}
}
备注
14 pages, 14 figures, 3 tables