中文

文本驱动的视频对象风格化

计算机视觉与模式识别 2022-06-28 v2

摘要

我们着手以直观且语义化的方式,根据用户指定的文本提示对视频中的对象进行风格化。这是一项具有挑战性的任务,因为所得视频必须满足多个性质:(1) 它必须在时间上一致,避免抖动或类似伪影;(2) 所得风格化必须同时保留对象的全局语义与细粒度细节;(3) 它必须遵循用户指定的文本提示。为此,我们的方法根据两个目标文本对视频中的对象进行风格化。第一个目标文本提示描述全局语义,第二个目标文本提示描述局部语义。为修改对象风格,我们利用 CLIP 的表征能力获得以下相似度分数:(1) 局部目标文本与一组局部风格化视图之间,以及 (2) 全局目标文本与一组风格化全局视图之间。我们使用预训练图集分解网络以时间一致的方式传播编辑。我们证明我们的方法能够为多种对象和视频生成随时间一致的风格变化,且符合目标文本的规定。我们还展示了改变目标文本的 specificity 并用一组前缀扩充文本如何产生具有不同细节层次的风格化。完整结果见我们的项目网页:https://sloeschcke.github.io/Text-Driven-Stylization-of-Video-Objects/

关键词

引用

@article{arxiv.2206.12396,
  title  = {Text-Driven Stylization of Video Objects},
  author = {Sebastian Loeschcke and Serge Belongie and Sagie Benaim},
  journal= {arXiv preprint arXiv:2206.12396},
  year   = {2022}
}