基于自我中心视频的 3D 场景实例跟踪
计算机视觉与模式识别
2024-06-10 v2
摘要
AR/VR 等自我中心(egocentric)传感器能够捕捉人-物交互,并具备通过回溯周围环境中感兴趣物体的 3D 位置来提供任务辅助的潜力。该能力需要在自我中心视频中对真实世界 3D 场景进行实例跟踪(IT3DEgo)。我们首先通过引入一个新的基准数据集来探索该问题,该数据集包含 RGB 与深度视频、逐帧相机位姿以及 2D 相机与 3D 世界坐标系下的实例级标注。我们提出了一种评估协议,在 3D 坐标系下评估跟踪性能,并提供两种注册待跟踪实例的设置:(1) 单视角在线注册,即根据穿戴者的交互即时指定实例;(2) 多视角预注册,即预先将待跟踪实例的图像存储在内存中。为解决 IT3DEgo 问题,我们首先复用了相关领域的方法,例如单目标跟踪(SOT)——运行 SOT 方法在 2D 帧中跟踪实例,并利用相机位姿与深度信息将其提升至 3D。我们还提出了一种简单方法,利用预训练的分割与检测模型从 RGB 帧中生成候选框,并将其与已注册实例图像进行匹配。实验表明,我们的方法(无需微调)在自我中心场景下显著优于基于 SOT 的方法。最后,我们论证了利用相机位姿并采用 3D 异己中心(世界)坐标表示能够使自我中心实例跟踪问题变得更为容易。
引用
@article{arxiv.2312.04117,
title = {Instance Tracking in 3D Scenes from Egocentric Videos},
author = {Yunhan Zhao and Haoyu Ma and Shu Kong and Charless Fowlkes},
journal= {arXiv preprint arXiv:2312.04117},
year = {2024}
}
备注
Accepted at CVPR 2024. Also presented at First Joint Egocentric Vision (EgoVis) Workshop @ CVPR 2024