MotionCharacter:面向人类视频生成的细粒度运动可控框架
计算机视觉与模式识别
2026-01-06 v3
摘要
最近的文本到视频个性化生成技术在合成角色特定内容方面取得了显著进展。然而,这些方法面临一个关键限制:无法对运动强度进行细粒度控制。这一限制源于在粗糙文本描述中行动语义及其对应幅度固有的纠缠,阻碍了生成细腻的人类视频,并限制了其在需高精度场景(如虚拟头像动画或合成微小表情)的应用。此外,现有方法常难以在修改其他属性时保持高身份保真度。为此,我们提出MotionCharacter,一个实现精确运动控制的高保真人类视频生成框架。其核心在于显式解耦运动为两个可独立控制的组成部分:动作类型与运动强度。这一技术通过两个关键贡献实现:(1) 运动控制模块利用文本短语指定动作类型,并基于光流导出的可量化指标调制其强度,辅以区域感知损失将运动局部化至相关主体区域;(2) ID 内容插入模块搭配 ID-一致性损失,确保在动态运动中保持身份一致性。为促进此类细粒度控制的训练,我们还构建了包含运动与面部特征详细标注的大型数据集Human-Motion。大量实验表明,MotionCharacter 在现有方法上实现了显著提升。该框架在生成视频方面,不仅身份一致性高,而且能精确遵循指定的运动类型与强度。
引用
@article{arxiv.2411.18281,
title = {MotionCharacter: Fine-Grained Motion Controllable Human Video Generation},
author = {Haopeng Fang and Di Qiu and Binjie Mao and He Tang},
journal= {arXiv preprint arXiv:2411.18281},
year = {2026}
}
备注
Accepted by AAAI 2026