高效情感视频面部分析的可扩展音视频掩码自编码器
计算机视觉与模式识别
2025-09-30 v1
摘要
情感视频面部分析(AVFA)已成为构建情感感知智能系统的关键研究领域,但该领域仍面临数据可获得性有限的问题。近年来,掩码自编码器(MAE)这一自监督学习(SSL)技术在音视频语境中的应用日益增长。尽管在一般多模态学习领域中规模化已被证明是突破的关键,但其在AVFA中的具体影响仍鲜有探索。另一个核心挑战在于通过可扩展的音视频表示捕获内部分析和跨模态相关性。为解决这些问题,我们提出了AVF-MAE++,一套旨在高效探索AVFA中规模化属性同时增强跨模态相关性建模的音视频MAE模型系列。我们的框架引入了音频和视觉模态上的新颖双掩码策略,并通过更整体的设计加强了模态编码器,以更好地支持可扩展的预训练。此外,我们提出了迭代音视频相关性学习模块,通过SSL范式改进相关性学习,弥补了前方法的局限性。为支持顺畅的适应并减少过拟合风险,我们进一步引入了渐进式语义注入策略,将模型训练组织为三个结构化阶段。在覆盖三个主要AVFA任务的17个数据集上进行的大量实验表明,AVF-MAE++在多个基准测试中一致实现了最先进的性能。 comprehensive ablation研究进一步突显了每个提议组件的重要性,并深入揭示了驱动这些改进的设计选择。我们的代码和模型已在Github上公开发布。
引用
@article{arxiv.2509.24214,
title = {Scalable Audio-Visual Masked Autoencoders for Efficient Affective Video Facial Analysis},
author = {Xuecheng Wu and Junxiao Xue and Xinyi Yin and Yunyun Shi and Liangyu Fu and Danlei Huang and Yifan Wang and Jia Zhang and Jiayu Nie and Jun Wang},
journal= {arXiv preprint arXiv:2509.24214},
year = {2025}
}