基于视觉-语言模型与伪标签提示的 3D/4D 面部表情识别无监督多视图对比语言-图像联合学习
计算机视觉与模式识别
2025-05-15 v1
摘要
本文介绍了 MultiviewVLM,这是一种视觉-语言模型,旨在从 3D/4D 数据中进行无监督对比多视图面部情绪表征学习。我们的架构整合了从生成的文本提示中导出的伪标签,以引导情绪语义的隐式对齐。为了捕获多视图间的共享信息,我们提出了一个联合嵌入空间,无需显式监督即可对齐多视图表征。我们进一步通过一种利用稳定的正负样本对采样的新颖多视图对比学习策略,增强了模型的判别能力。我们引入了一个对梯度友好的损失函数以促进更平滑、更稳定的收敛,并对模型进行了分布式训练优化以确保可扩展性。大量实验表明,MultiviewVLM 优于现有的 SOTA 方法,并且只需极少修改即可轻松适配各种真实世界应用。
引用
@article{arxiv.2505.09336,
title = {Unsupervised Multiview Contrastive Language-Image Joint Learning with Pseudo-Labeled Prompts Via Vision-Language Model for 3D/4D Facial Expression Recognition},
author = {Muzammil Behzad},
journal= {arXiv preprint arXiv:2505.09336},
year = {2025}
}