中文

AniMatrix:一种以艺术而非物理为思考对象的动漫视频生成模型

计算机视觉与模式识别 2026-05-12 v3 人工智能

摘要

视频生成模型内化了物理现实作为其先验。动漫刻意违反物理规律:运动模糊、冲击帧、卡通比例变化;以及数千种共存的艺术惯例没有单一的"动漫物理学"可供模型吸收。物理偏见的模型因此会平坦化构成该媒介特征的艺术性,或在风格变异性下崩溃。我们提出AniMatrix,一个面向艺术正确性而非物理正确性的视频生成模型,通过双通道条件机制和三步转换实现:重新定义正确性、覆盖物理先验、区分艺术与失效。首先,生产知识体系将动漫编码为可控生产变量的结构化分类法(Style、Motion、Camera、VFX),AniCaption从像素中推断这些变量作为导演指令。可训练标签编码器保留该分类法的 field-value 结构,而冻结的T5编码器处理自由形式叙述;双路径注入(交叉注意力用于细粒度控制,AdaLN调制用于全局强制)确保分类指令不会被开放文本稀释。其次,风格-运动-变形课程将模型从接近物理运动过渡到完全动漫表达。最后,采用领域特定奖励模型的变形感知偏好优化,将有意的艺术性与病态崩溃区分开来。在动漫专用的人类评估中,AniMatrix在五个生产维度上均排名第一,其中四个维度在Prompt Understanding(+0.70, +22.4%)和Artistic Motion(+0.55, +16.9%)上相较于Seedance-Pro 1.0获得最大提升。我们正在准备随附资源以支持可重复性和后续研究的公开发布。

关键词

引用

@article{arxiv.2605.03652,
  title  = {AniMatrix: An Anime Video Generation Model that Thinks in Art, Not Physics},
  author = {Tencent HY Team},
  journal= {arXiv preprint arXiv:2605.03652},
  year   = {2026}
}

备注

37 pages, 1 main figure (qualitative comparison), 1 TikZ architecture diagram; technical report. Model weights and inference code to be released