HiCMAE:用于自监督视听情感识别的层次化对比掩码自编码器
计算机视觉与模式识别
2024-04-02 v2 人机交互
多媒体
声音
音频与语音处理
摘要
视听情感识别(AVER)因其在构建情感感知智能机器中的关键作用,近年来受到越来越多的关注。该领域的先前工作主要由监督学习范式主导。尽管取得了显著进展,但由于 AVER 中长期存在的数据稀缺问题,监督学习正遭遇瓶颈。受自监督学习最新进展的启发,我们提出了层次化对比掩码自编码器(HiCMAE),这是一种新颖的自监督框架,利用大规模无标签视听数据进行大规模自监督预训练,以推动 AVER 的发展。遵循自监督视听表示学习的先前技术,HiCMAE 采用两种主要的自监督形式进行预训练,即掩码数据建模和对比学习。与它们仅关注顶层表示而忽略中间层显式引导的做法不同,HiCMAE 开发了一种三管齐下的策略,以促进层次化视听特征学习并提升所学表示的整体质量。为验证 HiCMAE 的有效性,我们在涵盖类别型和维度型 AVER 任务的 9 个数据集上进行了广泛实验。实验结果表明,我们的方法显著优于最先进的监督式和自监督式视听方法,这表明 HiCMAE 是一个强大的视听情感表示学习器。代码和模型将在 https://github.com/sunlicai/HiCMAE 上公开。
引用
@article{arxiv.2401.05698,
title = {HiCMAE: Hierarchical Contrastive Masked Autoencoder for Self-Supervised Audio-Visual Emotion Recognition},
author = {Licai Sun and Zheng Lian and Bin Liu and Jianhua Tao},
journal= {arXiv preprint arXiv:2401.05698},
year = {2024}
}
备注
Accepted by Information Fusion. The code is available at https://github.com/sunlicai/HiCMAE