SynergyNet:融合生成先验与状态空间模型的人脸美学预测
计算机视觉与模式识别
2025-09-23 v1
摘要
人脸美学的自动化预测是情感计算中的基准任务,需要对局部审美细节(如皮肤纹理)和全局面部和谐(如对称性、比例)进行精细理解。现有基于卷积神经网络(CNN)或视觉 Transformer(ViT)的模型存在固有的架构偏差,限制了性能;CNN 在局部特征提取方面表现突出,但在处理长程依赖方面受限,而 ViT 虽能建模全局关系,但计算成本高昂。本文引入了 \textbf{Mamba-Diffusion Network (MD-Net)},一种新型双流架构,通过赋予前沿模型特定角色来解决这一矛盾。第一流利用来自预训练潜在扩散模型的冻结 U-Net 编码器,为细粒度审美特征提供强大的生成先验。第二流采用视觉 Mamba(Vim),一种现代状态空间模型,能够以线性时间复杂度高效捕获全局面部结构。通过交叉注意力机制融合这些互补表征,MD-Net 构建了用于预测的整体且细致的特征空间。在 SCUT-FBP5500 数据集上进行评估,MD-Net 达到了新的状态最佳成绩,Pearson 相关系数为 \textbf{0.9235},展示了融合生成与序列建模范式以解决复杂视觉评估任务的显著潜力。
引用
@article{arxiv.2509.17172,
title = {SynergyNet: Fusing Generative Priors and State-Space Models for Facial Beauty Prediction},
author = {Djamel Eddine Boukhari},
journal= {arXiv preprint arXiv:2509.17172},
year = {2025}
}