OneHOI:统一的人-物相互作用生成与编辑
计算机视觉与模式识别
2026-04-16 v1 多媒体
摘要
人-物相互作用( HOI )建模捕捉人们如何对物体进行作用并与之关联,通常表现为 <person, action, object> 三元组。现有方法分为两大独立 family:HOI 生成从结构化三元组和布局合成场景,但难以整合如 HOI 和仅物体实体的混合条件;而 HOI 编辑通过文本修改相互作用,却难以分离姿态与物理接触并难以扩展到多个相互作用。我们提出 OneHOI,一个统一的扩散变换器框架,将 HOI 生成和编辑整合到单一的条件去噪过程中,由共享的结构化相互作用表示驱动。其核心是 Relational Diffusion Transformer( R-DiT ),通过动词中介的关系建模,运用角色和实例感知的 HOI 标记、基于布局的空间 Action Grounding、Structured HOI Attention 以强制执行相互作用拓扑,以及 HOI RoPE 以解耦多 HOI 场景。该模型在我们的 HOI-Edit-44K 数据集上联合训练(包含 HOI 和面向对象的-centric 数据集),支持布局引导、无布局、任意掩码和混合条件控制,实现了 HOI 生成和编辑的状态最优结果。代码已公开 https://jiuntian.github.io/OneHOI/。
引用
@article{arxiv.2604.14062,
title = {OneHOI: Unifying Human-Object Interaction Generation and Editing},
author = {Jiun Tian Hoe and Weipeng Hu and Xudong Jiang and Yap-Peng Tan and Chee Seng Chan},
journal= {arXiv preprint arXiv:2604.14062},
year = {2026}
}
备注
Accepted at CVPR2026. This paper moves toward unifying HOI generation and editing within a single model