中文

基于稀疏运动引导和多任务辅助的可控人物-物体互动视频生成

计算机视觉与模式识别 2026-03-11 v1

摘要

人物导向视频生成取得了快速进展,但现有方法在生成可控且物理一致的人物-物体互动(HOI)视频方面仍面临挑战。现有方法依赖稠密控制信号、模板视频或精心设计的文本提示,这限制了其灵活性和对新物体的泛化能力。我们引入 DISPLAY 框架,通过稀疏运动引导实现控制,仅使用手腕关节坐标和与形状无关的物体边界框。这种轻量级引导缓解了人物与物体表征之间的不平衡,实现了直观的用户控制。为提升稀疏条件下的表征质量,我们提出 Object-Stressed Attention 机制增强物体鲁棒性。为缓解高质量 HOI 数据的稀缺,我们进一步开发多任务辅助训练策略,配合专门的数据策展管道,使模型能同时从可靠的 HOI 样本和辅助任务中受益。全面实验表明,我们的方法在多样化任务上实现高保真、可控的 HOI 生成。项目页面可访问 \href{https://mumuwei.github.io/DISPLAY/}。

关键词

引用

@article{arxiv.2603.09883,
  title  = {DISPLAY: Directable Human-Object Interaction Video Generation via Sparse Motion Guidance and Multi-Task Auxiliary},
  author = {Jiazhi Guan and Quanwei Yang and Luying Huang and Junhao Liang and Borong Liang and Haocheng Feng and Wei He and Kaisiyuan Wang and Hang Zhou and Jingdong Wang},
  journal= {arXiv preprint arXiv:2603.09883},
  year   = {2026}
}