中文

面向3D意图预测的场景-动作跨注意力网络Int3DNet

计算机视觉与模式识别 2026-03-17 v1

摘要

我们提出Int3DNet,一种基于场景感知的网络,直接从场景几何与头部-手部动作线索预测3D意图区域,从而无需显式的对象级感知,实现对人类意图的稳健预测。在混合现实(MR)中,意图预测至关重要,因为它使系统能够提前预测用户动作并主动作出响应,从而减少交互延迟,确保无缝的用户体验。我们的方法采用稀疏动作线索与场景点云的跨注意力融合,提供一种直接解释用户在场景中空间意图的新方法。我们在MoGaze和CIRCLE数据集上评估了Int3DNet,这些是公开的人体-场景交互数据集,结果在时延最高可达1500ms的时间范围内保持一致性能,并优于基线模型,即便在多样化且未见的场景中亦如此。此外,我们通过演示基于意图区域的高效视觉问答(VQA)来展示了所提方法的可用性。Int3DNet提供可靠的3D意图区域,基于头部-手部动作与场景几何,从而通过对意图区域的主动处理,实现人类与MR系统之间的无缝交互。

关键词

引用

@article{arxiv.2603.13355,
  title  = {Int3DNet: Scene-Motion Cross Attention Network for 3D Intention Prediction in Mixed Reality},
  author = {Taewook Ha and Woojin Cho and Dooyoung Kim and Woontack Woo},
  journal= {arXiv preprint arXiv:2603.13355},
  year   = {2026}
}

备注

Accepted as an IEEE TVCG paper at IEEE VR 2026 (journal track)