融合ConvNeXt与Vision Transformer以增强面部年龄估计
计算机视觉与模式识别
2025-11-04 v1 机器学习
摘要
从面部图像进行年龄估计是计算机视觉中一个复杂且多方面的挑战。在本研究中,我们提出了一种新颖的混合架构,该架构结合了ConvNeXt(卷积神经网络的最新进展)与Vision Transformer。虽然每个模型在各种任务上独立地表现出色,但它们的集成利用了CNN局部特征提取能力和Transformer全局注意力机制的互补优势。我们提出的ConvNeXt-ViT混合解决方案在包括MORPH II、CACD和AFAD在内的基准年龄估计数据集上进行了全面评估,并在平均绝对误差方面取得了优越的性能。为了解决计算限制,我们利用预训练模型并系统地探索不同的配置,使用线性层和先进的正则化技术来优化架构。全面的消融研究强调了各个组件和训练策略的关键作用,并特别指出了在CNN框架内调整注意力机制以改善模型对年龄相关面部特征关注的重要性。结果表明,ConvNeXt-ViT混合模型不仅优于传统方法,而且为年龄估计及相关视觉任务的未来进展提供了坚实的基础。这项工作强调了混合架构的变革潜力,并代表了将CNN和Transformer无缝集成以解决复杂计算机视觉挑战的一个有前景的方向。
引用
@article{arxiv.2511.00123,
title = {Integrating ConvNeXt and Vision Transformers for Enhancing Facial Age Estimation},
author = {Gaby Maroun and Salah Eddine Bekhouche and Fadi Dornaika},
journal= {arXiv preprint arXiv:2511.00123},
year = {2025}
}