Mamba-CNN:一种用于高效准确面部美观度预测的混合架构
计算机视觉与模式识别
2025-09-03 v1
摘要
面部吸引力的计算评估是一项具有挑战性的主观回归任务,目前主流架构存在一个关键权衡:卷积神经网络(CNN)效率高但感受野有限,而视觉Transformer(ViT)能以二次计算成本建模全局上下文。为了解决这个问题,我们提出了 Mamba-CNN,一种新颖且高效的混合架构。Mamba-CNN 将一个轻量级的、受 Mamba 启发的状态空间模型(SSM)门控机制集成到分层卷积骨干网络中。这一核心创新使得网络能够动态调制特征图,并选择性地强调显著的面部特征及其长程空间关系,在保持计算效率的同时,模拟了人类的整体感知。我们在广泛使用的 SCUT-FBP5500 基准上进行了大量实验,我们的模型在该基准上达到了新的最优水平。Mamba-CNN 实现了 0.9187 的皮尔逊相关系数(PC)、0.2022 的平均绝对误差(MAE)和 0.2610 的均方根误差(RMSE)。我们的发现验证了将 CNN 与选择性 SSM 相结合的协同潜力,并为精细的视觉理解任务提供了一种强大的新架构范式。
引用
@article{arxiv.2509.01431,
title = {Mamba-CNN: A Hybrid Architecture for Efficient and Accurate Facial Beauty Prediction},
author = {Djamel Eddine Boukhari},
journal= {arXiv preprint arXiv:2509.01431},
year = {2025}
}