中文

GATS:面向不变4D时空点云表示的高斯感知时序缩放Transformer

计算机视觉与模式识别 2026-03-18 v1 人工智能

摘要

理解4D点云视频对于使智能体感知动态环境至关重要。然而, 随着帧率变化导致的时序尺度偏差以及不规则点云中分布不确定性, 设计统一且稳健的4D骨干网络极具挑战性。现有基于CNN或Transformer的方法要么受限于受限的感受野, 要么受限于二次计算复杂度, 同时忽视了这些隐式失真。为此,我们提出一种新型双不变框架, 称为\textbf{高斯感知时序缩放 (GATS)}, 明确解决分布不一致性和时序问题。我们提出的\emph{不确定性引导高斯卷积 (UGGC)} 将局部高斯统计信息和不确定性感知门控纳入点卷积中, 从而在密度变化、噪声和遮挡的情况下实现稳健的邻域聚合。并行地,\emph{时序缩放注意力 (TSA)} 引入可学习的缩放因子,以规范化时序距离, 确保帧分区不变性和不同帧率下的一致速度估计。这两个模块是互补的:时序缩放在高斯估计前规范化时间间隔, 而高斯建模增强了对不规则分布的鲁棒性。我们的实验在主流基准数据集MSR-Action3D(\textbf{+6.62\%}准确率)、NTU RGBD(\textbf{+1.4\%}准确率)和Synthia4D(\textbf{+1.8\%}mIoU)上均显示显著性能提升, 为提供一种更高效且原则化的范式以处理不变4D点云视频理解, 在准确性、鲁棒性和可扩展性方面均优于基于Transformer的方法。

关键词

引用

@article{arxiv.2603.16154,
  title  = {GATS: Gaussian Aware Temporal Scaling Transformer for Invariant 4D Spatio-Temporal Point Cloud Representation},
  author = {Jiayi Tian and Jiaze Wang},
  journal= {arXiv preprint arXiv:2603.16154},
  year   = {2026}
}