中文

CLUTCH:用于解锁文本条件手部运动建模的语义化语言模型

计算机视觉与模式识别 2026-02-23 v1 机器学习

摘要

手部在日常生活中占据核心位置,但建模自然手部运动仍未得到充分探索。现有方法解决文本到手部运动生成或手动画图字幕任务时,依赖的都是受控环境捕获的数据集,这些数据集涵盖的动作和情境有限,且规模化成本高。进一步地,当代模型及其训练方案难以捕捉动画保真度与文本-运动对齐之间的关系。为此,我们 (1) 引入'3D Hands in the Wild' (3D-HIW),一个包含 32K 个 3D 手部运动序列和对齐文本的数据集,以及 (2) 提出 CLUTCH,一个基于 LLM 的手动画系统,具备两个关键创新: (a) SHIFT,一种 novel VQ-VAE 架构用于对手部运动进行分词,以及 (b) 用于 fine-tune LLM 的几何细化阶段。为构建 3D-HIW,我们提出了结合视觉-语言模型(VLMs)和最先进的 3D 手部跟踪器的标注管道,并将其应用于覆盖广泛情境的大规模 egocentric action video 语料库中。为充分捕捉野外环境中的运动,CLUTCH 采用 SHIFT,即一种部分模态分解 VQ-VAE,以提高泛化能力和重构保真度。最后,为提高动画质量,我们引入了几何细化阶段,其中 CLUTCH 受到对解码手部运动参数直接应用的重构损失共同监督。实验表明,在文本到运动和运动到文本任务上,CLUTCH 实现了 state-of-the-art 性能,建立了可扩展的野外手部运动建模的第一个基准。代码、数据和模型将发布。

关键词

引用

@article{arxiv.2602.17770,
  title  = {CLUTCH: Contextualized Language model for Unlocking Text-Conditioned Hand motion modelling in the wild},
  author = {Balamurugan Thambiraja and Omid Taheri and Radek Danecek and Giorgio Becherini and Gerard Pons-Moll and Justus Thies},
  journal= {arXiv preprint arXiv:2602.17770},
  year   = {2026}
}

备注

ICLR2026; Project page: https://balamuruganthambiraja.github.io/CLUTCH/