中文

面向全身抓取运动生成的基于Transformer的统一框架与预训练

计算机视觉与模式识别 2025-07-02 v1

摘要

本文接受ICIP 2025的录用,提出了一种新型基于Transformer的框架,用于全身抓取,旨在解决姿态生成和运动填充问题,实现真实且稳定的对象交互。我们的管道包括三个阶段:全身抓取姿态生成、运动填充以及LiftUp Transformer,用于将降采样关节细化回高分辨率标记。为克服手部-对象交互数据稀缺的挑战,我们引入了在大规模多样化运动数据集上进行数据高效的Generalized预训练阶段,获得稳健的时空表示,可迁移到抓取任务。在GRAB数据集上的实验表明,我们的方法在连贯性、稳定性和视觉真实性方面均优于最先进的基线方法。模块化设计还支持轻松适应其他人体运动应用。

关键词

引用

@article{arxiv.2507.00676,
  title  = {A Unified Transformer-Based Framework with Pretraining For Whole Body Grasping Motion Generation},
  author = {Edward Effendy and Kuan-Wei Tseng and Rei Kawakami},
  journal= {arXiv preprint arXiv:2507.00676},
  year   = {2025}
}