基于文本引导的多视角融合的面部情感学习:用于3D/4D面部表情识别的视觉语言模型
计算机视觉与模式识别
2025-07-03 v1
摘要
3D和4D域中的面部表情识别(FER)在情感计算中因空间和时间面部动力学的复杂性而具有挑战性,其成功对于推动人类行为理解、健康监测和人机交互等应用至关重要。本文提出FACET-VLM,一个用于3D/4D FER的视觉语言框架,将多视角面部表征学习与来自自然语言提示的语义指导相结合。FACET-VLM引入了三个关键组件:用于视角一致融合的Cross-View Semantic Aggregation(CVSA),用于语义对齐面部情感的Multiview Text-Guided Fusion(MTGF),以及一种用于在各视角之间强制结构一致性的多视角一致性损失。我们的模型在多个基准测试(包括BU-3DFE、Bosphorus、BU-4DFE和BP4D-Spontaneous)上实现了最先进的准确率。我们进一步将FACET-VLM扩展到4D微表情识别(MER),在4DME数据集上 demonstrating in capturing subtle, short-lived emotional cues。大量实验结果确认了框架中每个单独组件的有效性和实质性贡献。总体而言,FACET-VLM为 multimodal FER在 posed 和 spontaneous 设置中提供了一个稳健、可扩展且性能卓越的解决方案。
引用
@article{arxiv.2507.01673,
title = {Facial Emotion Learning with Text-Guided Multiview Fusion via Vision-Language Model for 3D/4D Facial Expression Recognition},
author = {Muzammil Behzad},
journal= {arXiv preprint arXiv:2507.01673},
year = {2025}
}