用于第一视角三维手部轨迹预测的不确定性感知状态空间 Transformer
计算机视觉与模式识别
2023-09-19 v2
摘要
从第一视角(egocentric)视图进行手部轨迹预测对于在人与 AR/VR 系统交互时及时理解人类意图至关重要。然而,现有方法在二维图像空间中处理该问题,不足以满足三维真实世界应用的需求。本文设立了一项第一视角三维手部轨迹预测任务,旨在从早期观测到的一人称 RGB 视频中预测三维空间中的手部轨迹。为实现该目标,我们提出了一种不确定性感知状态空间 Transformer(USST),其结合了经典状态空间模型框架中注意力机制与偶然不确定性(aleatoric uncertainty)的优势。该模型可进一步通过速度约束及在大型视觉 Transformer 上的视觉提示微调(VPT)得到增强。此外,我们开发了一套标注流程以高质量地采集三维手部轨迹。在 H2O 与 EgoPAT3D 数据集上的实验结果表明,USST 在二维与三维轨迹预测上均具有优越性。代码与数据集已公开发布:https://actionlab-cv.github.io/EgoHandTrajPred。
引用
@article{arxiv.2307.08243,
title = {Uncertainty-aware State Space Transformer for Egocentric 3D Hand Trajectory Forecasting},
author = {Wentao Bao and Lele Chen and Libing Zeng and Zhong Li and Yi Xu and Junsong Yuan and Yu Kong},
journal= {arXiv preprint arXiv:2307.08243},
year = {2023}
}
备注
ICCV 2023 Accepted (Camera Ready)