AV-data2vec:基于上下文目标表示的音视觉语音表征自监督学习
音频与语音处理
2024-01-23 v2 人工智能
计算与语言
摘要
自监督通过大幅减少构建优良系统所需标注数据量,在音视觉语音识别中展现出巨大潜力。然而,现有方法要么并非完全端到端,要么未训练双模态的联合表示。本文提出 AV-data2vec,解决了这些挑战,并基于预测上下文表示(在单模态情形下已取得成功)来构建音视觉表示。该模型对音频与视频使用共享的 transformer 编码器,并可融合双模态以提升语音识别。在 LRS3 上的结果表明,在相同数据量与模型规模下,AV-data2vec 在所有设定中均稳定优于现有方法。
引用
@article{arxiv.2302.06419,
title = {AV-data2vec: Self-supervised Learning of Audio-Visual Speech Representations with Contextualized Target Representations},
author = {Jiachen Lian and Alexei Baevski and Wei-Ning Hsu and Michael Auli},
journal= {arXiv preprint arXiv:2302.06419},
year = {2024}
}
备注
2023 ASRU