人体运动视频生成:综述
计算机视觉与模式识别
2025-09-05 v1 多媒体
摘要
人体运动视频生成因其广泛应用而获得了显著的研究兴趣,催生了诸如照片级真实的歌唱头部或能够完美跟随音乐舞蹈的动态虚拟人等创新。然而,该领域现有的综述侧重于个别方法,缺乏对整个生成过程的全面概述。本文通过填补这一空白,提供了对人体运动视频生成的深入综述,涵盖了十余个子任务,并详细阐述了生成过程的五个关键阶段:输入、运动规划、运动视频生成、精炼和输出。值得注意的是,这是首次讨论大语言模型在增强人体运动视频生成中潜力的综述。我们的综述涵盖了三个主要模态——视觉、文本和音频——中人体运动视频生成的最新发展和技术趋势。通过涵盖两百余篇论文,我们提供了对该领域的全面概述,并突出了推动重大技术突破的里程碑成果。我们的综述旨在揭示人体运动视频生成的前景,并作为推动数字人综合应用的有价值资源。本综述中检查的模型完整列表可在我们的仓库 https://github.com/Winn1y/Awesome-Human-Motion-Video-Generation 获取。
引用
@article{arxiv.2509.03883,
title = {Human Motion Video Generation: A Survey},
author = {Haiwei Xue and Xiangyang Luo and Zhanghao Hu and Xin Zhang and Xunzhi Xiang and Yuqin Dai and Jianzhuang Liu and Zhensong Zhang and Minglei Li and Jian Yang and Fei Ma and Zhiyong Wu and Changpeng Yang and Zonghong Dai and Fei Richard Yu},
journal= {arXiv preprint arXiv:2509.03883},
year = {2025}
}
备注
Accepted by TPAMI. Github Repo: https://github.com/Winn1y/Awesome-Human-Motion-Video-Generation IEEE Access: https://ieeexplore.ieee.org/document/11106267