HuMo:基于协同多模态条件的人类中心视频生成
计算机视觉与模式识别
2025-09-11 v1 多媒体
摘要
人类中心视频生成(HCVG)方法旨在从多模态输入(包括文本、图像和音频)合成人类视频。现有方法因两个挑战难以有效协调这些异构模态:训练数据缺乏带有配对三元条件的稀缺性,以及难以协调主体保持和音视频同步的子任务。本文提出了一种名为HuMo的统一HCVG框架,用于协同多模态控制。针对第一个挑战,我们构建了一个包含多样化且配对的文本、参考图像和音频的高质量数据集。针对第二个挑战,我们提出了一种具有任务特定策略的两阶段渐进式多模态训练范式。对于主体保持任务,为维持基础模型的提示跟随能力和视觉生成能力,我们采用最小侵入性的图像注入策略。对于音视频同步任务,除了常用的音频跨注意力层外,我们提出了一种通过预测聚焦策略,隐式引导模型将音频与面部区域关联。对于跨多模态输入可控性的联合学习,基于已获取的能力,我们渐进式地纳入音视频同步任务。在推理阶段,为实现灵活且细粒度的多模态控制,我们设计了一种时间自适应的Classifier-Free Guidance策略,以动态调整去噪步骤中的引导权重。大量实验结果表明,HuMo在子任务上超越了专门的SOTA方法,建立了一个协同多模态条件下的统一HCVG框架。项目页面:https://phantom-video.github.io/HuMo
引用
@article{arxiv.2509.08519,
title = {HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning},
author = {Liyang Chen and Tianxiang Ma and Jiawei Liu and Bingchuan Li and Zhuowei Chen and Lijie Liu and Xu He and Gen Li and Qian He and Zhiyong Wu},
journal= {arXiv preprint arXiv:2509.08519},
year = {2025}
}