FlowHOI: 基于流匹配的语义导向手-物体交互生成用于灵巧机器人操作
机器人学
2026-02-17 v1 人工智能
计算机视觉与模式识别
摘要
最近的视觉-语言-动作 (VLA) 模型能够生成合理的末端执行器运动,但在长程、接触丰富的任务中常因未显式表示手-物体交互 (HOI) 结构而失败。一种能捕捉该结构且不依赖于具体机体的交互表示将使操作行为更容易验证并在不同机器人之间迁移。我们提出 FlowHOI,一个两阶段流匹配框架,用于生成语义导向、时序连贯的 HOI 序列,包括手部姿态、物体姿态和手-物体接触状态,基于俯瞰视角观察、语言指令和 3D 高斯溅射 (3DGS) 场景重建。我们将几何导向的抓握与语义导向的操作分离,后者基于紧凑的 3D 场景标记,并采用运动-文本对齐损失以语义方式将生成的交互在物理场景布局和语言指令中进行导向。为解决高保真 HOI 监督稀缺问题,我们引入一个重建管线,从大规模俯瞰视角视频中恢复对齐的手-物体轨迹和网格,为稳健生成提供 HOI 先验。跨 GRAB 和 HOT3D 数据集,FlowHOI 在动作识别准确率和物理仿真成功率上均优于最强的扩散基线 1.7 倍,同时实现 40 倍的推理加速。我们进一步在四个灵巧操作任务上实现了真实机器人执行,说明了将生成的 HOI 表示迁移到真实机器人执行管线的可行性。
引用
@article{arxiv.2602.13444,
title = {FlowHOI: Flow-based Semantics-Grounded Generation of Hand-Object Interactions for Dexterous Robot Manipulation},
author = {Huajian Zeng and Lingyun Chen and Jiaqi Yang and Yuantai Zhang and Fan Shi and Peidong Liu and Xingxing Zuo},
journal= {arXiv preprint arXiv:2602.13444},
year = {2026}
}
备注
Project Page: https://huajian-zeng.github.io/projects/flowhoi/