KlingAvatar 2.0 技术报告
计算机视觉与模式识别
2025-12-16 v1
摘要
头像视频生成模型在近年来取得了显著进展。然而,先前的工作在生成持续时长的高分辨率视频时效率有限,随着视频长度的增加,存在时间漂移、质量下降和提示跟随效果较差的问题。为此,我们提出 KlingAvatar 2.0,一种在空间分辨率和时间维度上进行升频的时空级联框架。该框架首先生成捕获全局语义和运动的低分辨率蓝图视频关键帧,然后通过 first-last frame 策略将其细化为高分辨率、时序一致的子片段,同时保持长时段视频中的平滑时序过渡。为增强在延长视频中的跨模态指令融合和对齐,我们引入由三个模态特定的大型语言模型 (LLM) 专家组成的 Co-Reasoning Director。这些专家推理模态优先级,推断用户意图,通过多轮对话将输入转换为详细的情节。Negative Director 进一步细化负面提示,以提高指令对齐。基于这些组件,我们将框架扩展以支持 ID 特定的多角色控制。大量实验表明,我们的模型有效地解决了高效、跨模态对齐的长时段高分辨率视频生成挑战,实现了增强的视觉清晰度、真实的唇齿渲染与准确唇同步、强身份保持以及连贯的多模态指令跟随。
引用
@article{arxiv.2512.13313,
title = {KlingAvatar 2.0 Technical Report},
author = {Kling Team and Jialu Chen and Yikang Ding and Zhixue Fang and Kun Gai and Yuan Gao and Kang He and Jingyun Hua and Boyuan Jiang and Mingming Lao and Xiaohan Li and Hui Liu and Jiwen Liu and Xiaoqiang Liu and Yuan Liu and Shun Lu and Yongsen Mao and Yingchao Shao and Huafeng Shi and Xiaoyu Shi and Peiqin Sun and Songlin Tang and Pengfei Wan and Chao Wang and Xuebo Wang and Haoxian Zhang and Yuanxing Zhang and Yan Zhou},
journal= {arXiv preprint arXiv:2512.13313},
year = {2025}
}
备注
14 pages, 7 figures