中文

从少量视频中学习动画化图像以展现精细的人类动作

计算机视觉与模式识别 2025-03-11 v2

摘要

尽管近期取得了进展,视频生成模型在将静态图像动画化为展现精细人类动作的视频方面仍然存在困难,尤其是在处理训练数据有限的罕见或新颖动作时。本文探讨了使用少量视频(16个或更少)将图像动画化为展现精细人类动作的任务,这对视频和电影制作等现实应用极具价值。在少样本设置中学习可泛化的运动模式,使用户提供的参考图像之间实现平滑过渡,是一项极具挑战性的任务。我们提出了 FLASH(Few-shot Learning to Animate and Steer Humans),该模型通过强制模型使用另一段具有相同运动但不同外观的视频的运动特征和帧间对应关系来重建视频,从而学习可泛化的运动模式。这鼓励了可迁移的运动学习,并减轻了对有限训练数据的过拟合。此外,FLASH 通过添加额外层扩展了解码器,将参考图像的细节传播到生成的帧中,提高了过渡平滑度。人类评估者压倒性地偏好 FLASH,在 488 条反馈中有 65.78% 选择 FLASH 优于基线方法。我们强烈建议观看网站上的视频:https://lihaoxin05.github.io/human_action_animation/,因为运动伪影在图像中难以察觉。

关键词

引用

@article{arxiv.2503.00276,
  title  = {Learning to Animate Images from A Few Videos to Portray Delicate Human Actions},
  author = {Haoxin Li and Yingchen Yu and Qilong Wu and Hanwang Zhang and Song Bai and Boyang Li},
  journal= {arXiv preprint arXiv:2503.00276},
  year   = {2025}
}