中文

HANDI:以手部为中心的文本-图像条件视频生成

计算机视觉与模式识别 2025-07-15 v5

摘要

尽管视频生成技术近期取得了长足进步,但最先进的方法在处理视觉细节方面仍存在困难。一个特别具有挑战性的案例是,需要结合手部的精细运动与一个基本稳定但容易分散注意力的环境,来传达某些复杂动作的执行及其效果。为解决这些挑战,我们提出了一种专注于以手部为中心的动作的视频生成新方法。我们的基于扩散模型的方法包含两项独特的创新。首先,我们提出了一种自动生成运动区域(即视频中发生详细活动的区域)的方法,该方法由视觉上下文和动作文本提示共同引导,而非像目前普遍做法那样假设该区域可以手动提供。其次,我们引入了一个关键的手部优化损失函数,以引导扩散模型专注于生成平滑且一致的手部姿态。我们在基于 EpicKitchens 和 Ego4D 构建的具有挑战性的增强数据集上评估了我们的方法,结果表明,在不同环境和动作下,动作清晰度,尤其是目标区域的手部运动清晰度,均显著优于最先进的方法。视频结果可在 https://excitedbutter.github.io/project_page 查看。

关键词

引用

@article{arxiv.2412.04189,
  title  = {HANDI: Hand-Centric Text-and-Image Conditioned Video Generation},
  author = {Yayuan Li and Zhi Cao and Jason J. Corso},
  journal= {arXiv preprint arXiv:2412.04189},
  year   = {2025}
}

备注

16 pages, 7 figures and 4 tables