中文

HOIGPT:利用语言模型学习长序列手-物交互

计算机视觉与模式识别 2025-03-26 v1

摘要

我们提出 HOIGPT,一种基于 token 的生成方法,统一了三维手-物交互(HOI)的感知与生成,提供了首个针对多样化条件信号(如文本、物体、部分序列)的高质量三维 HOI 序列描述与生成的综合解决方案。HOIGPT 的核心是利用一个大型语言模型来预测 HOI 序列与自然语言描述之间的双向变换。给定文本输入,HOIGPT 生成一系列手与物体的网格;给定(部分)HOI 序列,HOIGPT 生成文本描述并补全序列。为了借助大型语言模型实现 HOI 理解,本文引入了两项关键创新:(1)一种新颖的物理基础 HOI tokenizer,即手-物分解 VQ-VAE,用于将 HOI 序列离散化;(2)一个运动感知的语言模型,经过训练以处理和生成文本与 HOI token。大量实验表明,HOIGPT 在多个任务和基准上均取得了新的最先进性能,文本生成方面提升 +2.01% R Precision,HOI 生成方面降低 2.56 FID。

关键词

引用

@article{arxiv.2503.19157,
  title  = {HOIGPT: Learning Long Sequence Hand-Object Interaction with Language Models},
  author = {Mingzhen Huang and Fu-Jen Chu and Bugra Tekin and Kevin J Liang and Haoyu Ma and Weiyao Wang and Xingyu Chen and Pierre Gleize and Hongfei Xue and Siwei Lyu and Kris Kitani and Matt Feiszli and Hao Tang},
  journal= {arXiv preprint arXiv:2503.19157},
  year   = {2025}
}