中文

使用视觉-语言模型的自监督多视图表示学习用于 3D/4D 面部表情识别

计算机视觉与模式识别 2025-06-03 v1

摘要

面部表情识别(FER)是情感计算中的一项基础任务,应用于人机交互、心理健康分析与行为理解。在本文中,我们提出 SMILE-VLM,一种用于 3D/4D FER 的自监督视觉-语言模型,将多视图视觉表示学习与自然语言监督统一起来。SMILE-VLM 通过提出三个核心组件来学习鲁棒、语义对齐且视图不变的嵌入:通过 Barlow Twins 式损失实现的多视图去相关、视觉-语言对比对齐,以及跨模态冗余最小化。我们的框架在多个基准上取得了 SOTA 性能。我们进一步将 SMILE-VLM 扩展至 4D 微表情识别(MER)任务,以识别细微的情感线索。广泛的结果表明,SMILE-VLM 不仅超越了现有的无监督方法,而且匹配或超越了有监督基线,为富有表现力的面部行为理解提供了一种可扩展且标注高效的解决方案。

关键词

引用

@article{arxiv.2506.01203,
  title  = {Self-Supervised Multi-View Representation Learning using Vision-Language Model for 3D/4D Facial Expression Recognition},
  author = {Muzammil Behzad},
  journal= {arXiv preprint arXiv:2506.01203},
  year   = {2025}
}