Ego3DT:跟踪以自我中心视角为导向的视频中每一帧3D物体
计算机视觉与模式识别
2024-10-14 v1 多媒体
摘要
嵌入式智能的日益增长的关注度正在将自我中心视角引入当代研究。 然而,这一领域面临的一个重要挑战是,对自我中心视频中物体的精确定位与跟踪,主要由于视角变化幅度很大。 为了解决这一问题,本文提出了一种零样本方法,用于从自我中心视频中对所有物体进行3D重建和跟踪。 我们提出了 Ego3DT 框架,该框架最初识别并提取自我环境中物体的检测和分割信息。 通过利用相邻视频帧的信息,Ego3DT 动态地使用预训练的3D场景重建模型构建自我视角的3D场景。 此外,我们创新了一个动态层次关联机制,用于在自我中心视频中创建稳定的3D跟踪轨迹。 此外,通过在两个新构建的数据集上进行大量实验,我们证实了该方法的有效性,其 HOTA 指标提升了 1.04 倍至 2.90 倍,展示了该方法在多样化自我中心场景中的鲁棒性和准确性。
引用
@article{arxiv.2410.08530,
title = {Ego3DT: Tracking Every 3D Object in Ego-centric Videos},
author = {Shengyu Hao and Wenhao Chai and Zhonghan Zhao and Meiqi Sun and Wendi Hu and Jieyang Zhou and Yixian Zhao and Qi Li and Yizhou Wang and Xi Li and Gaoang Wang},
journal= {arXiv preprint arXiv:2410.08530},
year = {2024}
}
备注
Accepted by ACM Multimedia 2024