中文

M3L:基于语言的多模态多层次Transformer视频编辑

计算机视觉与模式识别 2022-03-22 v2

摘要

如今视频编辑工具被广泛用于数字设计。尽管对这些工具的需求很高,但所需的前置知识使新手难以入门。能够遵循自然语言指令进行自动编辑的系统将显著提升易用性。本文提出基于语言的视频编辑(LBVE)任务,该任务允许模型在文本指令引导下,将源视频编辑为目标视频。LBVE具有两个特点:1)保留源视频的场景,而非生成完全不同的视频;2)目标视频中语义呈现方式不同,且所有变化均由给定指令控制。我们提出多模态多层次Transformer(M3^3L)来执行LBVE。M3^3L在不同层次上动态学习视频感知与语言语义之间的对应关系,这有利于视频理解与视频帧合成。我们构建了三个新数据集用于评估,包括两个诊断性数据集和一个来自自然视频且带人工标注文本的数据集。大量实验结果表明,M3^3L对视频编辑是有效的,且LBVE可引领视觉与语言研究的新方向。

关键词

引用

@article{arxiv.2104.01122,
  title  = {M3L: Language-based Video Editing via Multi-Modal Multi-Level Transformers},
  author = {Tsu-Jui Fu and Xin Eric Wang and Scott T. Grafton and Miguel P. Eckstein and William Yang Wang},
  journal= {arXiv preprint arXiv:2104.01122},
  year   = {2022}
}

备注

CVPR'22