Multichannel AV-wav2vec2:学习多通道多模态语音表示的框架
音频与语音处理
2024-01-09 v1 声音
摘要
自监督语音预训练方法近年来发展迅速,已被证明对许多近场单通道语音任务非常有效。然而,远场多通道语音处理正遭受标记多通道数据稀缺和复杂环境噪声的困扰。自监督学习在远场多通道和多模态语音处理中的有效性尚未得到充分探索。鉴于视觉信息有助于提高噪声场景下的语音识别性能,在本工作中,我们提出了一个多通道多模态语音自监督学习框架 AV-wav2vec2,该框架利用视频和多通道音频数据作为输入。首先,我们提出了一种多路径结构来并行处理多通道音频流和视觉流,并以通道内和通道间对比损失作为训练目标,以充分利用多通道语音数据中的时空信息。其次,基于对比学习,我们使用额外的单通道音频数据进行联合训练,以提高语音表示的性能。最后,我们使用真实场景中的中文多通道多模态数据集,验证了所提方法在视听语音识别(AVSR)、自动语音识别(ASR)、视觉语音识别(VSR)和视听说话人日志(AVSD)任务上的有效性。
引用
@article{arxiv.2401.03468,
title = {Multichannel AV-wav2vec2: A Framework for Learning Multichannel Multi-Modal Speech Representation},
author = {Qiushi Zhu and Jie Zhang and Yu Gu and Yuchen Hu and Lirong Dai},
journal= {arXiv preprint arXiv:2401.03468},
year = {2024}
}
备注
Accepted by AAAI 2024