中文

作为结构化文本表示的动画布局生成

计算机视觉与模式识别 2025-05-05 v1

摘要

尽管文本到视频模型取得了显著进展,但在控制文本元素和动画图形方面仍具有显著挑战,这在诸如视频广告等应用中尤为突出。为此,我们提出一种名为 Animated Layout Generation 的新方法,以扩展具有时间动态性的静态图形布局。我们提出一种结构化文本表示,通过层次化视觉元素实现精细的视频控制。为展示该方法的有效性,我们呈现 VAKER (Video Ad maKER),一个将三阶段生成过程与非结构化文本推理相结合以实现与大语言模型 (LLM) 无缝集成的文本到视频广告生成管道。VAKER 完全自动化视频广告生成,通过为特定视频帧中的对象和图形实现动态布局轨迹来实现。通过广泛的评估,我们展示了 VAKER 在生成视频广告方面显著优于现有方法。项目页面: https://yeonsangshin.github.io/projects/Vaker

关键词

引用

@article{arxiv.2505.00975,
  title  = {Generating Animated Layouts as Structured Text Representations},
  author = {Yeonsang Shin and Jihwan Kim and Yumin Song and Kyungseung Lee and Hyunhee Chung and Taeyoung Na},
  journal= {arXiv preprint arXiv:2505.00975},
  year   = {2025}
}

备注

AI for Content Creation (AI4CC) Workshop at CVPR 2025