MIR-GAN:利用对抗网络精炼帧级模态不变表示以用于音视觉语音识别
音频与语音处理
2023-06-21 v1 计算机视觉与模式识别
多媒体
声音
摘要
音视觉语音识别(AVSR)近期因利用多模态信号理解人类语音而引发大量研究兴趣。解决该任务的主流方法已发展出复杂的架构与多模态融合及表示学习技术。然而,不同模态的自然异质性导致其表示间存在分布差异,使融合颇具挑战。本文旨在学习跨模态的共享表示以弥合差异。不同于情感分析等其他多模态任务上已有的类似方法,我们针对AVSR的序列到序列任务设定关注时间上下文依赖。具体而言,我们提出一种对抗网络以精炼帧级模态不变表示(MIR-GAN),其捕捉跨模态共性以简化后续多模态融合过程。在公开基准LRS3和LRS2上的大量实验表明,我们的方法优于最先进水平。
引用
@article{arxiv.2306.10567,
title = {MIR-GAN: Refining Frame-Level Modality-Invariant Representations with Adversarial Network for Audio-Visual Speech Recognition},
author = {Yuchen Hu and Chen Chen and Ruizhe Li and Heqing Zou and Eng Siong Chng},
journal= {arXiv preprint arXiv:2306.10567},
year = {2023}
}
备注
14 pages, 5 figures, Accepted by ACL 2023