InteractAnything:基于 LLM 反馈与物体可供性解析的零样本人-物交互合成
计算机视觉与模式识别
2025-06-02 v1
摘要
3D 感知人体生成的最新进展取得了显著成果。然而,现有方法在从文本生成新颖的人-物交互方面仍然存在困难,特别是对于开放集物体。我们确定了该任务的三个主要挑战:精确的人-物关系推理、任意物体的可供性解析,以及与描述和物体几何对齐的详细人体交互姿态合成。在这项工作中,我们提出了一种新颖的零样本 3D HOI 生成框架,无需在特定数据集上进行训练,利用了大规模预训练模型的知识。具体而言,从大型语言模型推断人-物关系,以初始化物体属性并指导优化过程。然后,我们利用预训练的 2D 图像扩散模型来解析未见物体并提取接触点,避免了现有 3D 资产知识带来的限制。基于输入文本和物体几何,通过基于多视图 SDS 采样多个假设来生成初始人体姿态。最后,我们引入了详细的优化以生成细粒度、精确且自然的交互,强制执行 3D 物体与相关身体部位(包括抓握中的手)之间的真实 3D 接触。这是通过从 LLM 中提取人类级别的反馈来从文本指令中捕获详细的人-物关系来实现的。大量实验验证了我们的方法与先前工作相比的有效性,特别是在交互的细粒度性质和处理开放集 3D 物体的能力方面。
引用
@article{arxiv.2505.24315,
title = {InteractAnything: Zero-shot Human Object Interaction Synthesis via LLM Feedback and Object Affordance Parsing},
author = {Jinlu Zhang and Yixin Chen and Zan Wang and Jie Yang and Yizhou Wang and Siyuan Huang},
journal= {arXiv preprint arXiv:2505.24315},
year = {2025}
}
备注
CVPR 2025