文本引导的欧拉型电影图合成
计算机视觉与模式识别
2023-09-27 v3 图形学
机器学习
摘要
我们提出 Text2Cinemagraph,一种从文本描述自动创建电影图(cinemagraph)的全自动化方法——当提示包含虚构元素与艺术风格时,由于解读这些图像的语义与运动具有复杂性,这是一项尤其具有挑战性的任务。我们关注流体元素(如流动河流与漂移云朵)的电影图,其展现连续运动与重复纹理。现有的单图像动画方法在艺术输入上表现不佳,而近期基于文本的 video 方法常引入时间不一致性,难以保持某些区域静止。为应对这些挑战,我们提出从单一文本提示合成图像孪生的思路——一对艺术图像与其像素对齐的自然外观孪生图像。艺术图像描绘文本提示中详述的风格与外观,而写实对应图像极大简化了布局与运动分析。利用现有的自然图像与视频数据集,我们可准确分割写实图像并根据语义信息预测合理运动。预测的运动随后可迁移至艺术图像以创建最终电影图。我们的方法在自然景观以及艺术与其他世界场景的电影图创建上优于现有方法,这由自动化指标与用户研究验证。最后,我们展示了两个扩展:为现有画作添加动画,以及使用文本控制运动方向。
引用
@article{arxiv.2307.03190,
title = {Text-Guided Synthesis of Eulerian Cinemagraphs},
author = {Aniruddha Mahapatra and Aliaksandr Siarohin and Hsin-Ying Lee and Sergey Tulyakov and Jun-Yan Zhu},
journal= {arXiv preprint arXiv:2307.03190},
year = {2023}
}
备注
Project website: https://text2cinemagraph.github.io/website/