中文

SPORTS:用于城市场景理解的同步全景运动、渲染、跟踪与分割

计算机视觉与模式识别 2025-10-15 v1

摘要

场景感知、理解与仿真是具身 AI 智能体的基本技术,而现有方法仍易出现分割不足、动态物体干扰、传感器数据稀疏以及视角受限等问题。本文提出一种新框架,名为 SPORTS,通过将视频全景分割(VPS)、视觉运动(VO)和场景渲染(SR)任务紧密集成于一个迭代且统一的视角中,实现整体场景理解。首先,VPS 设计一种自适应注意力几何融合机制,通过引入姿态、深度和光流模态,对齐跨帧特征,自动调整不同解码阶段的特征图。同时集成一种后匹配策略以提高身份跟踪精度。在 VO 中,来自 VPS 的全景分割结果与光流图相结合,以提高动态物体置信度估计,从而通过学习范式增强相机姿态估计和稠密深度图生成的完整性。此外,SR 的基于点的渲染受益于 VO,将稀疏点云转化为神经场,以合成高保真 RGB 视图和双全景视图。在三个公开数据集上的大量实验表明,我们的注意力驱动的特征融合在运动学、跟踪、分割和新视角合成等任务上超越了大多数现有的前沿方法。

关键词

引用

@article{arxiv.2510.12749,
  title  = {SPORTS: Simultaneous Panoptic Odometry, Rendering, Tracking and Segmentation for Urban Scenes Understanding},
  author = {Zhiliu Yang and Jinyu Dai and Jianyuan Zhang and Zhu Yang},
  journal= {arXiv preprint arXiv:2510.12749},
  year   = {2025}
}

备注

Accepted by IEEE Transactions on Multimedia