中文

AV-data2vec:基于上下文目标表示的音视觉语音表征自监督学习

音频与语音处理 2024-01-23 v2 人工智能 计算与语言

摘要

自监督通过大幅减少构建优良系统所需标注数据量,在音视觉语音识别中展现出巨大潜力。然而,现有方法要么并非完全端到端,要么未训练双模态的联合表示。本文提出 AV-data2vec,解决了这些挑战,并基于预测上下文表示(在单模态情形下已取得成功)来构建音视觉表示。该模型对音频与视频使用共享的 transformer 编码器,并可融合双模态以提升语音识别。在 LRS3 上的结果表明,在相同数据量与模型规模下,AV-data2vec 在所有设定中均稳定优于现有方法。

关键词

引用

@article{arxiv.2302.06419,
  title  = {AV-data2vec: Self-supervised Learning of Audio-Visual Speech Representations with Contextualized Target Representations},
  author = {Jiachen Lian and Alexei Baevski and Wei-Ning Hsu and Michael Auli},
  journal= {arXiv preprint arXiv:2302.06419},
  year   = {2024}
}

备注

2023 ASRU