中文

X4D-SceneFormer:通过跨模态知识迁移增强4D点云视频的场景理解

计算机视觉与模式识别 2023-12-13 v1

摘要

4D点云理解领域正在迅速发展,其目标是分析动态3D点云序列。然而,由于点云的稀疏性和缺乏纹理,这仍然是一项具有挑战性的任务。此外,点云的不规则性在对齐视频序列内的时间信息时造成了困难。为了解决这些问题,我们提出了一种新颖的跨模态知识迁移框架,称为 X4D-SceneFormer。该框架通过使用具有时间关系挖掘的 Transformer 架构,从 RGB 序列中迁移纹理先验来增强 4D 场景理解。具体而言,该框架采用双分支架构设计,由一个 4D 点云 Transformer 和一个梯度感知图像 Transformer (Gradient-aware Image Transformer, GIT) 组成。在训练期间,我们采用多种知识迁移技术,包括时间一致性损失和掩码自注意力机制,以加强模态间的知识迁移。这使得在推理阶段仅使用单模态 4D 点云输入即可获得增强的性能。大量实验表明,我们的框架在各种 4D 点云视频理解任务中表现出卓越的性能,包括动作识别、动作分割和语义分割。在 HOI4D 挑战赛\footnote{\url{http://www.hoi4d.top/}.} 中,结果取得了第一名,即 4D 动作分割和语义分割的准确率分别达到 85.3% (+7.9%) 和 47.3% (+5.0%) mIoU,大幅超越了先前最先进的方法。我们在 https://github.com/jinglinglingling/X4D 发布了代码。

关键词

引用

@article{arxiv.2312.07378,
  title  = {X4D-SceneFormer: Enhanced Scene Understanding on 4D Point Cloud Videos through Cross-modal Knowledge Transfer},
  author = {Linglin Jing and Ying Xue and Xu Yan and Chaoda Zheng and Dong Wang and Ruimao Zhang and Zhigang Wang and Hui Fang and Bin Zhao and Zhen Li},
  journal= {arXiv preprint arXiv:2312.07378},
  year   = {2023}
}