中文

MUGEN:一个用于视频-音频-文本多模态理解与生成的游乐场

计算机视觉与模式识别 2022-04-29 v3 人工智能

摘要

视频-音频-文本多模态理解与生成可以从狭窄但丰富的数据集中受益。狭窄性提供了研究界可以取得进展的碎片化挑战。丰富性确保我们沿着核心挑战取得进展。为此,我们提出了一个大规模视频-音频-文本数据集 MUGEN,使用开源平台游戏 CoinRun [11] 收集。我们进行了大量修改,通过引入音频和启用新交互使游戏更丰富。我们训练了具有不同目标的 RL 智能体来导航游戏并与 13 个对象和角色交互。这使我们能够自动提取大量多样化视频及关联音频。我们采样了 375K 个视频片段(每个 3.2 秒)并从人类标注者处收集文本描述。每个视频都有从游戏引擎自动提取的额外标注,例如每帧的准确语义图和模板化文本描述。总之,MUGEN 可帮助推进多模态理解与生成中许多任务的研究。我们在涉及视频-音频-文本检索和生成的任务上对代表性方法进行了基准测试。我们的数据集和代码发布于:https://mugen-org.github.io/。

关键词

引用

@article{arxiv.2204.08058,
  title  = {MUGEN: A Playground for Video-Audio-Text Multimodal Understanding and GENeration},
  author = {Thomas Hayes and Songyang Zhang and Xi Yin and Guan Pang and Sasha Sheng and Harry Yang and Songwei Ge and Qiyuan Hu and Devi Parikh},
  journal= {arXiv preprint arXiv:2204.08058},
  year   = {2022}
}