无需分类器即可释放引导信号,用于人类-物体交互动画生成
计算机视觉与模式识别
2026-03-27 v1
摘要
生成真实的人类-物体交互 (HOI) 动画仍然具有挑战性,因为它需要联合建模动态人类动作和多样化的物体几何形状。先前的扩散方法通常依赖手工设计的接触先验或人为施加的运动学约束来改善接触质量。我们提出 LIGHT,一种数据驱动的替代方案,其中引导信号源自去噪过程本身,减少了对人工设计先验的依赖。基于扩散强迫,我们将表示分解为模态特定分量,并通过异步去噪调度分配个体化的噪声水平。在这一范式中,更干净的组件通过交叉注意力引导噪声更多的组件,从而在不依赖辅助分类器的情况下实现引导。我们发现这种数据驱动的引导本质上具有接触感知能力,并且当训练中增强了大量合成物体几何形状时可以得到进一步提升,鼓励接触语义对几何多样性的不变性。大量实验表明,由节奏诱导的引导比传统的无分类器引导更有效地模拟了接触先验的益处,同时实现了更高的接触保真度、更真实的 HOI 生成,以及对未见物体和任务的更强泛化能力。
引用
@article{arxiv.2603.25734,
title = {Unleashing Guidance Without Classifiers for Human-Object Interaction Animation},
author = {Ziyin Wang and Sirui Xu and Chuan Guo and Bing Zhou and Jiangshan Gong and Jian Wang and Yu-Xiong Wang and Liang-Yan Gui},
journal= {arXiv preprint arXiv:2603.25734},
year = {2026}
}
备注
Project Page: http://ziyinwang1.github.io/LIGHT