FunHOI:基于功能性文本引导的无标注 3D 手部-物体交互生成
机器人学
2025-07-11 v2 计算机视觉与模式识别
摘要
手部-物体交互(HOI)是人类与环境之间的基本联系,然而其灵巧且复杂的姿态给手势控制带来了巨大挑战。尽管人工智能和机器人技术取得了重大进展,使机器能够理解和模拟手部-物体交互,但捕获功能性抓取任务的语义仍然是一个相当大的挑战。虽然以前的工作可以生成稳定且正确的 3D 抓取,但由于未考虑抓取语义,它们仍远未实现功能性抓取。为了应对这一挑战,我们提出了一种创新的两阶段框架——功能性抓取合成网络(FGS-Net),用于由功能性文本驱动的 3D HOI 生成。该框架由一个文本引导的 3D 模型生成器——功能性抓取生成器(FGG),以及一个姿态优化策略——功能性抓取精炼器(FGR)组成。FGG 根据文本输入生成手部和物体的 3D 模型,而 FGR 使用物体姿态近似器和能量函数对姿态进行微调,以确保手部与物体之间的相对位置符合人类意图并在物理上保持合理。大量实验表明,我们的方法无需额外的 3D 标注数据即可实现精确且高质量的 HOI 生成。
引用
@article{arxiv.2502.20805,
title = {FunHOI: Annotation-Free 3D Hand-Object Interaction Generation via Functional Text Guidanc},
author = {Yongqi Tian and Xueyu Sun and Haoyuan He and Linji Hao and Ning Ding and Caigui Jiang},
journal= {arXiv preprint arXiv:2502.20805},
year = {2025}
}