Text-Animator:可控的视觉文本视频生成
计算机视觉与模式识别
2024-06-26 v1
摘要
视频生成在游戏、电子商务和广告等多个行业是一项具有挑战性但至关重要的任务。在T2V中一个尚未解决的重要方面是生成视频中文本的有效可视化。尽管文本到视频(T2V)生成取得了进展,但当前方法仍无法直接在视频中有效可视化文本,因为它们主要侧重于总结语义场景信息、理解和描绘动作。虽然最近在图像级视觉文本生成方面的进展显示出前景,但将这些技术过渡到视频领域面临问题,特别是在保持文本保真度和运动连贯性方面。在本文中,我们提出了一种名为Text-Animator的创新方法,用于视觉文本视频生成。Text-Animator包含一个文本嵌入注入模块,以精确描绘生成视频中视觉文本的结构。此外,我们开发了一个相机控制模块和一个文本细化模块,通过控制相机运动以及可视化文本的运动来提高生成视觉文本的稳定性。定量和定性实验结果表明,我们的方法在生成视觉文本的准确性方面优于最先进的视频生成方法。项目页面可在https://laulampaul.github.io/text-animator.html找到。
引用
@article{arxiv.2406.17777,
title = {Text-Animator: Controllable Visual Text Video Generation},
author = {Lin Liu and Quande Liu and Shengju Qian and Yuan Zhou and Wengang Zhou and Houqiang Li and Lingxi Xie and Qi Tian},
journal= {arXiv preprint arXiv:2406.17777},
year = {2024}
}
备注
Project Page: https://laulampaul.github.io/text-animator.html