中文

Kling-Avatar:级联长时程虚拟人动画合成中的多模态指令接地

计算机视觉与模式识别 2025-09-18 v2

摘要

音频驱动的虚拟人视频生成的最新进展显著增强了视听真实感。然而,现有方法仅将指令条件视为由声学或视觉线索驱动的低级跟踪,而没有对指令所传达的交际目的进行建模。这一局限性损害了其叙事连贯性和角色表现力。为弥合这一差距,我们引入了Kling-Avatar,一种新颖的级联框架,将多模态指令理解与照片级真实的人像生成统一起来。我们的方法采用两阶段流水线。在第一阶段,我们设计了一个多模态大语言模型(MLLM)导演,它根据多样的指令信号生成蓝图视频,从而控制高级语义,如角色运动和情感。在第二阶段,在蓝图关键帧的引导下,我们使用首尾帧策略并行生成多个子片段。这种从全局到局部的框架在忠实编码多模态指令背后的高级意图的同时,保留了细粒度细节。我们的并行架构还支持长时程视频的快速稳定生成,使其适用于数字人直播和Vlog等现实应用。为了全面评估我们的方法,我们构建了一个包含375个精选样本的基准,涵盖多样的指令和具有挑战性的场景。大量实验表明,Kling-Avatar能够生成高达1080p和48fps的生动、流畅、长时程视频,在唇形同步精度、情感和动态表现力、指令可控性、身份保持和跨域泛化方面均取得了优越性能。这些结果确立了Kling-Avatar作为语义接地、高保真音频驱动虚拟人合成的新基准。

关键词

引用

@article{arxiv.2509.09595,
  title  = {Kling-Avatar: Grounding Multimodal Instructions for Cascaded Long-Duration Avatar Animation Synthesis},
  author = {Yikang Ding and Jiwen Liu and Wenyuan Zhang and Zekun Wang and Wentao Hu and Liyuan Cui and Mingming Lao and Yingchao Shao and Hui Liu and Xiaohan Li and Ming Chen and Xiaoqiang Liu and Yu-Shen Liu and Pengfei Wan},
  journal= {arXiv preprint arXiv:2509.09595},
  year   = {2025}
}

备注

Technical Report. Project Page: https://klingavatar.github.io/