PanoVOS:以Transformer桥接非全景与全景视频分割
计算机视觉与模式识别
2024-07-30 v5
摘要
全景视频包含更丰富的空间信息,并因在自动驾驶和虚拟现实等领域中的卓越体验而受到极大关注。然而,现有的视频分割数据集仅关注传统的平面图像。为应对这一挑战,本文提出一个全景视频数据集 PanoVOS。该数据集提供 150 个具有高视频分辨率和多样运动的视频。为量化 2D 平面视频与全景视频之间的领域差距,我们在 PanoVOS 上评估了 15 个现成的视频对象分割 (VOS) 模型。通过误差分析,我们发现它们均无法处理全景视频的像素级内容不连续。因此,我们提出全景空间一致性 Transformer (PSCFormer),它能有效利用前一帧的语义边界信息与第二帧进行像素级匹配。大量实验表明,与之前的 SOTA 模型相比,我们的 PSCFormer 网络在全景设定下的分割结果具有显著优势。我们的数据集在全景 VOS 中提出了新挑战,希望 PanoVOS 能推动全景分割/跟踪的发展。
引用
@article{arxiv.2309.12303,
title = {PanoVOS: Bridging Non-panoramic and Panoramic Views with Transformer for Video Segmentation},
author = {Shilin Yan and Xiaohao Xu and Renrui Zhang and Lingyi Hong and Wenchao Chen and Wenqiang Zhang and Wei Zhang},
journal= {arXiv preprint arXiv:2309.12303},
year = {2024}
}
备注
ECCV 2024