基于变换器的单目视频移动物体分割
计算机视觉与模式识别
2024-12-02 v1 人工智能
摘要
从单目移动相机视频中检测和分割移动物体是一项具有挑战性的任务,需理解识别、运动和3D几何。将识别与重构结合,归结为融合问题,需为分类和分割组合外观特征和运动特征。本文提出了一种新颖的融合架构用于单目运动分割 - M3Former,利用变换器在分割和多模态融合方面的强大性能。由于从单目视频重建运动是反问题,本文系统分析了不同2D和3D运动表示及其对分割性能的重要性。最后,我们分析了训练数据效果,表明需要多样化数据集才能在Kitti和Davis上实现SotA性能。
引用
@article{arxiv.2411.19141,
title = {On Moving Object Segmentation from Monocular Video with Transformers},
author = {Christian Homeyer and Christoph Schnörr},
journal= {arXiv preprint arXiv:2411.19141},
year = {2024}
}
备注
WICCV2023