中文

PvNeXt:重新思考点云视频识别的网络设计与时序运动

计算机视觉与模式识别 2025-04-08 v1

摘要

点云视频感知已成为3D视觉领域的一项重要任务。当前的4D表征学习技术通常采用迭代处理结合密集查询操作。尽管这种方法在捕获时序特征方面很有效,但会导致大量的计算冗余。在这项工作中,我们提出了一个名为PvNeXt的框架,通过个性化的一次性查询操作,实现有效且高效的点云视频识别。具体而言,PvNeXt由两个关键模块组成:运动模仿器和单步运动编码器。前一个模块运动模仿器旨在捕获点云序列中固有的时序动态,从而生成对应于每一帧的虚拟运动。单步运动编码器执行一步查询操作,将每一帧的点云与其对应的虚拟运动帧相关联,从而从点云序列中提取运动线索并捕获整个序列的时序动态。通过整合这两个模块,PvNeXt能够对每一帧进行个性化的一次性查询,有效消除了对逐帧循环和密集查询过程的需求。在多个基准上的大量实验证明了我们方法的有效性。

关键词

引用

@article{arxiv.2504.05075,
  title  = {PvNeXt: Rethinking Network Design and Temporal Motion for Point Cloud Video Recognition},
  author = {Jie Wang and Tingfa Xu and Lihe Ding and Xinjie Zhang and Long Bai and Jianan Li},
  journal= {arXiv preprint arXiv:2504.05075},
  year   = {2025}
}

备注

Accepted by ICLR 2025