一种用于视听语音表示学习的多模态动态变分自编码器
声音
2024-02-21 v3 机器学习
多媒体
音频与语音处理
摘要
在本文中,我们提出一种多模态动态 VAE(MDVAE),应用于无监督视听语音表示学习。潜空间被结构化以将模态间共享的潜动态因子与各模态特有的因子分离开来。还引入一个静态潜变量来编码在一段视听语音序列中随时间恒定的信息。该模型在一个视听情感语音数据集上以无监督方式分两阶段训练。在第一阶段,为每个模态独立学习一个矢量量化 VAE(VQ-VAE),不进行时间建模。第二阶段在于在 VQ-VAE 量化前的中间表示上学习 MDVAE 模型。静态与动态之间、以及模态特定与模态公共信息之间的解耦发生在第二阶段训练期间。我们进行了大量实验以探究视听语音潜因子如何在 MDVAE 的潜空间中被编码。这些实验包括操控视听语音、视听人脸图像去噪以及视听语音情感识别。结果表明 MDVAE 有效地在其潜空间中结合了音频与视觉信息。它们还表明,所学得的视听语音静态表示可用于以少量标注数据进行情感识别,并且相较于单模态基线以及基于视听 transformer 架构的先进监督模型具有更好的准确率。
引用
@article{arxiv.2305.03582,
title = {A multimodal dynamical variational autoencoder for audiovisual speech representation learning},
author = {Samir Sadok and Simon Leglaive and Laurent Girin and Xavier Alameda-Pineda and Renaud Séguier},
journal= {arXiv preprint arXiv:2305.03582},
year = {2024}
}
备注
14 figures, https://samsad35.github.io/site-mdvae/