基于视频的级联多语言音视觉学习
计算与语言
2021-11-10 v1 计算机视觉与模式识别
多媒体
声音
音频与语音处理
图像与视频处理
摘要
在本文中,我们探索从教学视频中学习的自监督音视觉模型。先前的工作表明,这些模型在大规模视频数据集上训练后,可以将口语单词和声音与视觉内容关联起来,但它们仅在英语视频上训练和评估。为了学习多语言音视觉表示,我们提出了一种级联方法,该方法利用在英语视频上训练的模型,并将其应用于其他语言的音视觉数据,例如日语视频。通过我们的级联方法,与仅在日语视频上训练相比,我们展示了检索性能近 10 倍的提升。我们还将英语视频上训练的模型应用于日语和印地语的图像口语描述,取得了最先进的性能。
引用
@article{arxiv.2111.04823,
title = {Cascaded Multilingual Audio-Visual Learning from Videos},
author = {Andrew Rouditchenko and Angie Boggust and David Harwath and Samuel Thomas and Hilde Kuehne and Brian Chen and Rameswar Panda and Rogerio Feris and Brian Kingsbury and Michael Picheny and James Glass},
journal= {arXiv preprint arXiv:2111.04823},
year = {2021}
}
备注
Presented at Interspeech 2021. This version contains updated results using the YouCook-Japanese dataset