中文

通过多模态自蒸馏学习自监督音视觉语音表示

音频与语音处理 2022-12-07 v1 声音

摘要

本工作中,我们提出一种名为AV2vec的新方法,通过多模态自蒸馏学习音视觉语音表示。AV2vec包含一个学生模块与一个教师模块,其中学生使用由教师在线生成的多模态目标特征执行掩码潜在特征回归任务。教师模型的参数由学生动量更新得到。由于目标特征在线生成,AV2vec无需像AV-HuBERT那样进行迭代步骤,总训练时间成本降低至不到五分之一。我们进一步在本研究中提出AV2vec-MLM,其通过多任务学习以掩码语言模型(MLM)风格损失增强AV2vec。实验结果表明,AV2vec取得了与AV-HuBERT基线相当的性能。当结合MLM风格损失时,AV2vec-MLM优于基线并在下游任务上取得最佳性能。

关键词

引用

@article{arxiv.2212.02782,
  title  = {Self-Supervised Audio-Visual Speech Representations Learning By Multimodal Self-Distillation},
  author = {Jing-Xuan Zhang and Genshun Wan and Zhen-Hua Ling and Jia Pan and Jianqing Gao and Cong Liu},
  journal= {arXiv preprint arXiv:2212.02782},
  year   = {2022}
}

备注

submitted to ICASSP 2023