Re-HOLD:基于自适应布局指导扩散模型的人体-物体交互视频重作
计算机视觉与模式识别
2025-03-26 v3
摘要
当前数字人研究仅聚焦于唇形同步与身体动作,已不足以满足日益增长的工业需求,而支持与真实环境(如物体)交互的人类视频生成技术尚未得到充分探索。尽管人手合成已是一项复杂问题,但生成与手部接触且与之相互作用的物体,尤其是在物体尺寸与形状显著变化时,更显得具有更大的挑战性。为此,我们提出一种新型视频重作框架,专注于人体-物体交互(HOI),称为 Re-HOLD,即基于自适应布局指导扩散模型。我们的关键思想是为手部与物体分别采用专门的布局表示,从而实现对手部建模与物体在多样化动作序列中的适应性之间的有效解耦。为进一步提升 HOI 生成质量,我们设计了针对手部与物体的交互式纹理增强模块,引入两个独立的记忆库。我们还提出一种布局调整策略,以适应跨物体重作场景,在推理时可自适应调整因物体尺寸差异导致的不合理布局。全面的定性与定量评估表明,我们的框架显著优于现有方法。项目页面:https://fyycs.github.io/Re-HOLD。
引用
@article{arxiv.2503.16942,
title = {Re-HOLD: Video Hand Object Interaction Reenactment via adaptive Layout-instructed Diffusion Model},
author = {Yingying Fan and Quanwei Yang and Kaisiyuan Wang and Hang Zhou and Yingying Li and Haocheng Feng and Errui Ding and Yu Wu and Jingdong Wang},
journal= {arXiv preprint arXiv:2503.16942},
year = {2025}
}
备注
Accepted to CVPR 2025