一种用于视听语音情感识别的向量量化掩码自编码器
声音
2025-05-12 v3 机器学习
多媒体
音频与语音处理
摘要
情感识别中的一个重要挑战是开发能够利用无标签训练数据的方法。本文提出 VQ-MAE-AV 模型,一种自监督多模态模型,利用掩码自编码器在无标签情况下学习视听语音的表示。该模型包含向量量化变分自编码器,将原始音频和视觉语音数据压缩为离散 token。视听语音 token 用于训练一个由带注意力机制的编码器-解码器架构组成的多模态掩码自编码器。该模型旨在提取视听语音的局部(即帧级)和全局(即序列级)表示。在自监督预训练期间,VQ-MAE-AV 模型在大规模无标签视听语音数据集上训练,任务是重建随机掩码的视听语音 token,并采用对比学习策略。在此预训练过程中,编码器学习提取视听语音的表示,该表示随后可用于情感识别。在有监督微调阶段,一个小型分类模型在 VQ-MAE-AV 编码器之上训练以完成情感识别任务。所提方法在受控和真实(in-the-wild)条件下的多个数据集上均取得了最先进的情感识别结果。
引用
@article{arxiv.2305.03568,
title = {A vector quantized masked autoencoder for audiovisual speech emotion recognition},
author = {Samir Sadok and Simon Leglaive and Renaud Séguier},
journal= {arXiv preprint arXiv:2305.03568},
year = {2025}
}
备注
13 pages, 6 figures, https://samsad35.github.io/VQ-MAE-AudioVisual/