DreamActor-H1:通过运动设计的扩散Transformer实现高保真人-产品演示视频生成
计算机视觉与模式识别
2025-08-28 v2 人工智能
摘要
在电子商务和数字营销中,生成高保真人-产品演示视频对于有效的产品展示至关重要。然而,大多数现有框架要么无法同时保持人类和产品的身份,要么缺乏对人-产品空间关系的理解,导致不真实的表示和不自然的交互。为应对这些挑战,我们提出了一个基于扩散Transformer (DiT) 的框架。我们的方法通过注入配对的人-产品参考信息并利用额外的掩码交叉注意力机制,同时保持了人类身份和产品特定细节(如标志和纹理)。我们采用 3D 人体网格模板和产品边界框来提供精确的运动引导,实现手势与产品放置的直观对齐。此外,结构化文本编码用于融入类别级语义,增强跨帧小角度旋转时的 3D 一致性。在混合数据集上训练并采用广泛的数据增强策略后,我们的方法在保持人类和产品身份完整性以及生成逼真的演示动作方面优于最先进的技术。项目页面:https://lizhenwangt.github.io/DreamActor-H1/。
引用
@article{arxiv.2506.10568,
title = {DreamActor-H1: High-Fidelity Human-Product Demonstration Video Generation via Motion-designed Diffusion Transformers},
author = {Lizhen Wang and Zhurong Xia and Tianshu Hu and Pengrui Wang and Pengfei Wei and Zerong Zheng and Ming Zhou and Yuan Zhang and Mingyuan Gao},
journal= {arXiv preprint arXiv:2506.10568},
year = {2025}
}