中文

AVATAR 参加 Ego4D 音视频转写挑战赛的方案

计算机视觉与模式识别 2022-11-21 v1 多媒体 声音 音频与语音处理 图像与视频处理

摘要

在本报告中,我们描述了提交给 Ego4D 音视频(AV)语音转写挑战赛 2022 的方案。我们的流程基于 AVATAR,一种用于 AV-ASR 的先进编码器-解码器模型,其对频谱图和 RGB 图像进行早期融合。我们描述了数据集、实验设置和消融实验。我们的最终方法在挑战赛测试集上取得了 68.40 的 WER,比基线高出 43.7%,并赢得了该挑战赛。

关键词

引用

@article{arxiv.2211.09966,
  title  = {AVATAR submission to the Ego4D AV Transcription Challenge},
  author = {Paul Hongsuck Seo and Arsha Nagrani and Cordelia Schmid},
  journal= {arXiv preprint arXiv:2211.09966},
  year   = {2022}
}