AVATAR 参加 Ego4D 音视频转写挑战赛的方案
计算机视觉与模式识别
2022-11-21 v1 多媒体
声音
音频与语音处理
图像与视频处理
摘要
在本报告中,我们描述了提交给 Ego4D 音视频(AV)语音转写挑战赛 2022 的方案。我们的流程基于 AVATAR,一种用于 AV-ASR 的先进编码器-解码器模型,其对频谱图和 RGB 图像进行早期融合。我们描述了数据集、实验设置和消融实验。我们的最终方法在挑战赛测试集上取得了 68.40 的 WER,比基线高出 43.7%,并赢得了该挑战赛。
引用
@article{arxiv.2211.09966,
title = {AVATAR submission to the Ego4D AV Transcription Challenge},
author = {Paul Hongsuck Seo and Arsha Nagrani and Cordelia Schmid},
journal= {arXiv preprint arXiv:2211.09966},
year = {2022}
}