为自我中心视频估计更多相机位姿对VQ3D至关重要
计算机视觉与模式识别
2022-11-21 v1
摘要
视觉查询三维定位(VQ3D)是Ego4D情景记忆基准中的一项任务。给定一段自我中心视频,目标是回答形如“我最后一次看到物体X是在哪里?”的查询,其中查询物体X由一张静态图像指定,答案应为指向物体X的三维位移向量。然而,当前技术采用朴素方法估计视频帧的相机位姿,导致带位姿查询(QwP)比例较低,从而整体成功率较差。我们在工作中针对这一具有挑战性的自我中心视频相机位姿估计问题设计了一条新流程。此外,我们重新审视当前的VQ3D框架,并从性能与效率两方面对其进行了优化。最终,我们在VQ3D排行榜上取得了25.8%的整体成功率第一名,该结果比基线报告的8.7%高出两倍。
引用
@article{arxiv.2211.10284,
title = {Estimating more camera poses for ego-centric videos is essential for VQ3D},
author = {Jinjie Mai and Chen Zhao and Abdullah Hamdi and Silvio Giancola and Bernard Ghanem},
journal= {arXiv preprint arXiv:2211.10284},
year = {2022}
}
备注
Second International Ego4D Workshop at ECCV 2022