中文

AnchorHOI: 基于锚框先验蒸馏的零样文本驱动4D人体-物体交互生成

计算机视觉与模式识别 2025-12-17 v1

摘要

尽管监督式方法在文本驱动的4D人体-物体交互(HOI)生成方面取得了显著进展,但由于缺乏大规模4D HOI数据集,扩展性仍受限。为克服这一问题,近期方法尝试利用预训练图像扩散模型实现零样4D HOI生成。然而,交互线索在生成过程中被蒸馏的程度有限,限制了其在多样化场景中的适用性。本文提出AnchorHOI,一种新型框架,通过纳入视频扩散模型(超越图像扩散模型)来充分利用混合先验,推动4D HOI生成。在实际中,直接利用此类先验优化高维4D HOI仍具挑战性,尤其是针对人体姿态和组成运动。为此,AnchorHOI引入基于锚框的先验蒸馏策略,构建交互感知锚框,再据此以可管理的两步过程引导生成。具体而言,为4D HOI生成设计了两个量身定制的锚框:用于表达交互构图的锚框神经射出场(NeRFs),以及用于实现真实运动合成的锚框关键点。大量实验表明,AnchorHOI在保持优异多样性和泛化能力的同时,超越了先前方法的性能。

关键词

引用

@article{arxiv.2512.14095,
  title  = {AnchorHOI: Zero-shot Generation of 4D Human-Object Interaction via Anchor-based Prior Distillation},
  author = {Sisi Dai and Kai Xu},
  journal= {arXiv preprint arXiv:2512.14095},
  year   = {2025}
}

备注

AAAI 2026