中文

面向全面面部状态分析的多模态表征学习技术

计算机视觉与模式识别 2025-04-15 v1

摘要

多模态基础模型通过整合来自多个模态的信息,显著提升了特征表征,适用于更广泛的应用场景。然而,面向感知理解的多模态面部表征探索仍有限。理解和分析面部状态(如动作单元 AU 和情绪),需要一个全面且稳健的框架,将视觉模态与语言模态对接。本文提出了一套全面且完善的多模态面部状态分析管线。首先,我们编译了新的多模态面部数据集(MFA),通过利用 GPT-4o 生成面部的详细多层次语言描述,纳入动作单元(AU)和情绪描述。其次,我们引入一种新型多层次多模态面部基础模型(MF^2),专为动作单元(AU)和情绪识别设计。该模型在面部图像的局部和全局层面进行全面视觉特征建模,增强了对面部细节外观的表征能力。该设计将视觉表征与结构化的 AU 和情绪描述对齐,确保有效的跨模态集成。最后,我们开发了一种解耦式微调网络(DFN),高效地将 MF^2 适配到各种任务和数据集。该方法不仅降低了计算开销,也拓宽了基础模型适用于多种场景的范围。实验结果显示,在 AU 和情绪检测任务上,本方法表现优异。

关键词

引用

@article{arxiv.2504.10351,
  title  = {Multimodal Representation Learning Techniques for Comprehensive Facial State Analysis},
  author = {Kaiwen Zheng and Xuri Ge and Junchen Fu and Jun Peng and Joemon M. Jose},
  journal= {arXiv preprint arXiv:2504.10351},
  year   = {2025}
}

备注

Accepted by ICME2025