从不变动作基准推理演化而来的 EigenActor:基于不变动作基准的变体身体-物体交互生成
计算机视觉与模式识别
2025-03-05 v2
摘要
本文探索了一个跨模态合成任务,即从给定的文本指令推断 3D 人体-物体交互 (Human-Object Interaction, HOI)。现有的文本到 HOI 合成方法主要部署从文本直接映射到特定物体的 3D 身体动作的直接映射,可能遇到性能瓶颈,因为巨大的跨模态鸿沟。本文观察到,那些对同一交互意图针对不同目标的 HOI 样本,例如 "lift a chair" 和 "lift a cup",总是包含相似的动作特定身体动作模式,同时刻画不同的物体特定交互样式。因此,学习有效的动作特定运动先验和物体特定交互先验对文本到 HOI 模型至关重要,它主导了文本-HOI 语义一致性和身体-物体交互真实性的性能。在此基础上,我们提出了一种 novel 的身体姿态生成策略,用于文本到 HOI 任务:首先推断物体无关的规范身体动作,然后丰富物体特定的交互样式。具体而言,第一个规范身体动作推断阶段专注于学习类内共享的身体运动先验并将给定的文本语义映射到动作特定的规范 3D 身体动作。随后,在物体特定的交互推断阶段,我们专注于物体 affordance 学习并在推断的动作特定身体动作基础上丰富物体特定的交互样式。大量实验验证了我们提出的文本到 HOI 合成系统在三个大规模数据集上显著优于其他 SOTA 方法,具有更好的语义一致性和交互真实性性能。
引用
@article{arxiv.2503.00382,
title = {EigenActor: Variant Body-Object Interaction Generation Evolved from Invariant Action Basis Reasoning},
author = {Xuehao Gao and Yang Yang and Shaoyi Du and Yang Wu and Yebin Liu and Guo-Jun Qi},
journal= {arXiv preprint arXiv:2503.00382},
year = {2025}
}