中文

Text2LIVE:文本驱动的分层图像与视频编辑

计算机视觉与模式识别 2022-05-26 v2

摘要

我们提出一种用于自然图像与视频中零样本、文本驱动外观操控的方法。给定输入图像或视频及目标文本提示,我们的目标是以语义有意义的方式编辑现有对象(如对象纹理)的外观,或用视觉效果(如烟雾、火焰)增强场景。我们使用从单一输入(图像或视频及目标文本提示)提取的内部训练样本集训练生成器,同时利用外部预训练 CLIP 模型确立损失。我们的关键思想不是直接生成编辑后输出,而是生成叠加在原始输入之上的编辑层(颜色+不透明度)。这使我们能通过直接应用于编辑层的新型文本驱动损失约束生成过程并保持对原始输入的高保真。我们的方法既不依赖预训练生成器,也不需要用户提供的编辑掩膜。我们展示了在高分辨率自然图像与视频上跨多种对象与场景的局部化语义编辑。

关键词

引用

@article{arxiv.2204.02491,
  title  = {Text2LIVE: Text-Driven Layered Image and Video Editing},
  author = {Omer Bar-Tal and Dolev Ofri-Amar and Rafail Fridman and Yoni Kasten and Tali Dekel},
  journal= {arXiv preprint arXiv:2204.02491},
  year   = {2022}
}

备注

Project page: https://text2live.github.io