中文

面向长期四维点云视频理解的基点Transformer

计算机视觉与模式识别 2022-12-21 v2

摘要

本文提出一种用于长期点云视频理解的四维骨干网络。捕获时空上下文的典型方式是使用无层级的四维卷积或Transformer。然而,由于相机运动、场景变化、采样模式以及四维数据的复杂性,这些方法既不够有效也不够高效。为解决这些问题,我们利用基元平面作为中间表示来捕获四维点云视频中的长期时空上下文,并提出一种名为基点Transformer(Point Primitive Transformer, PPTr)的新型层级骨干网络,其主要由基元内点Transformer与基元Transformer组成。大量实验表明,PPTr在不同任务上均优于以往的SOTA方法。

关键词

引用

@article{arxiv.2208.00281,
  title  = {Point Primitive Transformer for Long-Term 4D Point Cloud Video Understanding},
  author = {Hao Wen and Yunze Liu and Jingwei Huang and Bo Duan and Li Yi},
  journal= {arXiv preprint arXiv:2208.00281},
  year   = {2022}
}