超越画框:预测基于身体姿态的三维视觉范围
计算机视觉与模式识别
2025-11-25 v1
摘要
人们持续根据驱动其探索和行为的潜在意图来感知和与周围环境互动。虽然围绕以运动和接触为基础的交互的镜像用户和场景理解研究已聚焦于此,但预测人类视觉感知本身仍较少被探索,尽管其在指导人类行为方面起着根本作用,并且对 AR/VR 和辅助技术具有重要意义。我们解决了镜像三维视觉范围预测的挑战,预测人类视觉感知将在其三维环境中聚焦的下一个位置。为此,我们提出了一种新方法 EgoSpanLift,将镜像视觉范围预测从二维图像平面转换为三维场景。EgoSpanLift 将由 SLAM 提取的关键点转换为适合凝视的几何结构,并提取体积化视觉范围区域。我们进一步将 EgoSpanLift 与 3D U-Net 和单向变换器结合,实现对未来三维网格中视觉范围的时空融合以高效预测。在此基础上,我们从原始镜像多感官数据中构建了全面的基准数据集,创建了 364.6K 样本的三维视觉范围预测测试舱。我们的做法在镜像二维凝视预测和三维定位方面均优于竞争性基线方法,即使在投影回二维图像平面而不进行额外二维特定训练时,也可实现相当好的结果。
引用
@article{arxiv.2511.18470,
title = {Gaze Beyond the Frame: Forecasting Egocentric 3D Visual Span},
author = {Heeseung Yun and Joonil Na and Jaeyeon Kim and Calvin Murdock and Gunhee Kim},
journal= {arXiv preprint arXiv:2511.18470},
year = {2025}
}
备注
NeurIPS 2025 Spotlight