HunyuanCustom:一种用于定制视频生成的多模态驱动架构
计算机视觉与模式识别
2025-05-09 v2
摘要
定制视频生成旨在根据灵活的用户定义条件生成包含特定主体的视频,然而现有方法常常在身份一致性和有限的输入模态方面遇到困难。在本文中,我们提出了HunyuanCustom,这是一个多模态定制视频生成框架,强调主体一致性,同时支持图像、音频、视频和文本条件。我们的模型基于HunyuanVideo构建,首先通过引入一个基于LLaVA的文本-图像融合模块来增强多模态理解,以及一个利用时间拼接来强化跨帧身份特征的图像ID增强模块,从而解决图像-文本条件生成任务。为了实现音频和视频条件生成,我们进一步提出了模态特定的条件注入机制:一个通过空间交叉注意力实现分层对齐的AudioNet模块,以及一个通过基于分块的特征对齐网络集成潜在压缩条件视频的视频驱动注入模块。在单主体和多主体场景上的大量实验表明,HunyuanCustom在ID一致性、真实感和文本-视频对齐方面显著优于最先进的开源和闭源方法。此外,我们验证了其在下游任务(包括音频和视频驱动的定制视频生成)中的鲁棒性。我们的结果突显了多模态条件和身份保持策略在推进可控视频生成方面的有效性。所有代码和模型均可在https://hunyuancustom.github.io获取。
引用
@article{arxiv.2505.04512,
title = {HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation},
author = {Teng Hu and Zhentao Yu and Zhengguang Zhou and Sen Liang and Yuan Zhou and Qin Lin and Qinglin Lu},
journal= {arXiv preprint arXiv:2505.04512},
year = {2025}
}