HANDI:以手部为中心的文本-图像条件视频生成
计算机视觉与模式识别
2025-07-15 v5
摘要
尽管视频生成技术近期取得了长足进步,但最先进的方法在处理视觉细节方面仍存在困难。一个特别具有挑战性的案例是,需要结合手部的精细运动与一个基本稳定但容易分散注意力的环境,来传达某些复杂动作的执行及其效果。为解决这些挑战,我们提出了一种专注于以手部为中心的动作的视频生成新方法。我们的基于扩散模型的方法包含两项独特的创新。首先,我们提出了一种自动生成运动区域(即视频中发生详细活动的区域)的方法,该方法由视觉上下文和动作文本提示共同引导,而非像目前普遍做法那样假设该区域可以手动提供。其次,我们引入了一个关键的手部优化损失函数,以引导扩散模型专注于生成平滑且一致的手部姿态。我们在基于 EpicKitchens 和 Ego4D 构建的具有挑战性的增强数据集上评估了我们的方法,结果表明,在不同环境和动作下,动作清晰度,尤其是目标区域的手部运动清晰度,均显著优于最先进的方法。视频结果可在 https://excitedbutter.github.io/project_page 查看。
引用
@article{arxiv.2412.04189,
title = {HANDI: Hand-Centric Text-and-Image Conditioned Video Generation},
author = {Yayuan Li and Zhi Cao and Jason J. Corso},
journal= {arXiv preprint arXiv:2412.04189},
year = {2025}
}
备注
16 pages, 7 figures and 4 tables