中文

Social-MAE:基于Transformer的面部与语音多模态自编码器

计算机视觉与模式识别 2025-08-26 v1

摘要

人类社会行为本质上是多模态的,这要求开发强大的音视频模型来进行感知。本文提出了Social-MAE,我们的预训练音视频掩码自编码器(Masked Autoencoder, MAE)基于扩展的Contrastive Audio-Visual Masked Auto-Encoder(CAV-MAE),在音视频社交数据上进行预训练。具体而言,我们修改CAV-MAE以接收更多的帧作为输入,并在大型人类社交互动数据集(VoxCeleb2)上以自监督方式进行预训练。我们通过在不同的社交和情感下游任务上进行微调和评估来展示该模型的有效性,包括情感识别、笑声检测和显性人格估计。该模型在多模态情感识别和笑声识别方面实现了最先进的成绩,并在显性人格估计方面取得具竞争力的成绩,展示了面向领域的自监督预训练的有效性。代码和模型权重可在此处获取:https://github.com/HuBohy/SocialMAE。

关键词

引用

@article{arxiv.2508.17502,
  title  = {Social-MAE: A Transformer-Based Multimodal Autoencoder for Face and Voice},
  author = {Hugo Bohy and Minh Tran and Kevin El Haddad and Thierry Dutoit and Mohammad Soleymani},
  journal= {arXiv preprint arXiv:2508.17502},
  year   = {2025}
}

备注

5 pages, 3 figures, IEEE FG 2024 conference