中文

动态文字扩散模型

流体动力学 2024-07-16 v1

摘要

本文提出了一种用于生成用户偏好的可动画文本内容的逼真动态文字方法。我们借鉴了近期视频扩散模型的进展,以实现视觉上令人愉悦的文字外观。为此,我们首先构建了一个动态文字数据集,包含约60万个视频。该数据集由584个专业动态图形设计师设计的模板组合而成,涉及改变每个字母的位置、字形和大小(例如,飞行、故障、色差、反射等效果)。接着,我们提出了一种用于动态文字的视频扩散模型。为此,需要满足三个要求:美观的外观、动态效果和可读的字母。本文确定了这些要求。为此,我们使用静态和动态提示词分别作为视频扩散模型的时空引导。静态提示词描述视频的整体外观,如颜色、纹理和代表每个字母形状的字形。动态提示词描述字母和背景的运动。我们还使用零卷积添加了一个额外的引导,以确定视频中应显示哪些文本内容。我们将零卷积应用于文本内容,并将其作用于扩散模型。最后,我们提出了一个损失函数,仅最小化预测词与真实词之间的差异,以确保预测的字母可读。实验表明,我们的模型能够根据文本提示生成具有艺术性和可读字母运动的动态文字视频。

关键词

引用

@article{arxiv.2407.10475,
  title  = {Large-eddy simulation of hydrodynamic noise from turbulent flows past an axisymmetric hull using high-order schemes},
  author = {Peng Jiang and Shijun Liao and Bin Xie},
  journal= {arXiv preprint arXiv:2407.10475},
  year   = {2024}
}

备注

20 pages, 16 figures