中文

QORT-Former:面向双手操作物体理解的查询优化实时 Transformer

计算机视觉与模式识别 2025-02-28 v1

摘要

在理解双手操作物体的姿态和交互方面已取得显著进展。增强现实(AR)和虚拟现实(VR)技术的出现,提高了这些应用对实时性能的需求。然而,当前的领先模型往往在牺牲大量计算开销方面取得了亮眼结果。本文提出了查询优化实时 Transformer(QORT-Former),这是首个基于 Transformer 的双手和物体 3D 姿态估计实时框架。我们首先限制查询数和解码器数量以满足效率要求。针对查询数和解码器有限的情况,我们提出优化查询的方法,这些查询作为 Transformer 解码器的输入,以确保更好的准确性:(1)将查询分为三类(左手查询、右手查询和物体查询),并增强查询特征;(2)利用手与物体之间的接触信息;(3)采用三步方式相互更新增强后的图像和查询特征。通过上述方法,我们仅使用108个查询和1个解码器即可实现实时姿态估计(在 RTX 3090Ti GPU 上达到 53.5 FPS)。在 H2O 数据集上超越领先结果(左手提升 17.6%,右手提升 22.8%,物体提升 27.2%),在 FPHA 数据集上也取得显著进步(右手提升 5.3%,物体提升 10.4%), our 方法在准确性方面表现出色。此外,它在交互识别方面实现了领先水平,同时保持实时效率,采用即插即用的动作识别模块。

关键词

引用

@article{arxiv.2502.19769,
  title  = {QORT-Former: Query-optimized Real-time Transformer for Understanding Two Hands Manipulating Objects},
  author = {Elkhan Ismayilzada and MD Khalequzzaman Chowdhury Sayem and Yihalem Yimolal Tiruneh and Mubarrat Tajoar Chowdhury and Muhammadjon Boboev and Seungryul Baek},
  journal= {arXiv preprint arXiv:2502.19769},
  year   = {2025}
}

备注

Accepted to AAAI 2025