中文

PTTA:面向高质量动画创作的纯文本到动画框架

计算机视觉与模式识别 2025-12-23 v1 人工智能

摘要

传统动画制作涉及复杂的管道和显著的手动劳动成本。虽然最近的视频生成模型如Sora、Kling和CogVideoX在自然视频合成方面取得了令人印象深刻的结果,但在动画生成方面存在明显局限。最近的工作如AniSora通过微调图像到视频模型以适应动画风格,然而在文本到视频设置中类似的探索仍有限。本文提出PTTA,一个面向高质量动画创建的纯文本到动画框架。我们首先构建了一个小规模但高质量的动画视频和文本描述配对数据集。基于预训练的文本到视频模型HunyuanVideo进行微调,以适应动画风格的生成。跨多个维度的大量视觉评估显示,所提出的方法在动画视频合成中始终优于相当的基线。

关键词

引用

@article{arxiv.2512.18614,
  title  = {PTTA: A Pure Text-to-Animation Framework for High-Quality Creation},
  author = {Ruiqi Chen and Kaitong Cai and Yijia Fan and Keze Wang},
  journal= {arXiv preprint arXiv:2512.18614},
  year   = {2025}
}

备注

Under submission