中文

ByteLoom:通过渐进式课程学习编织几何一致的人-物交互

计算机视觉与模式识别 2026-03-27 v2 图形学 机器学习

摘要

人-物交互(HOI)视频生成因其在数字人、电子商务、广告和机器人模仿学习中的广阔应用前景而受到越来越多的关注。然而,现有方法面临两个关键局限性:(1)缺乏将物体的多视图信息注入模型的有效机制,导致跨视图一致性差;(2)严重依赖细粒度手部网格标注来建模交互遮挡。为了应对这些挑战,我们引入了 ByteLoom,这是一个基于 Diffusion Transformer (DiT) 的框架,利用简化的人体条件和 3D 物体输入,生成具有几何一致物体外观的逼真 HOI 视频。我们首先提出了一种 RCM-cache 机制,该机制利用相对坐标图(RCM)作为通用表示,以保持物体的几何一致性,同时精确控制物体的 6-DoF 变换。为了弥补 HOI 数据集的稀缺性并利用现有数据集,我们进一步设计了一种训练课程,以渐进式方式增强模型能力,并降低对手部网格的需求。大量实验表明,我们的方法忠实地保留了人体身份和物体的多视图几何,同时保持了平滑的运动和物体操作。

关键词

引用

@article{arxiv.2512.22854,
  title  = {ByteLoom: Weaving Geometry-Consistent Human-Object Interactions through Progressive Curriculum Learning},
  author = {Bangya Liu and Xinyu Gong and Zelin Zhao and Ziyang Song and Yulei Lu and Suhui Wu and Jun Zhang and Suman Banerjee and Hao Zhang},
  journal= {arXiv preprint arXiv:2512.22854},
  year   = {2026}
}