用于自动驾驶中类别无关分割的多尺度视频 Transformer
计算机视觉与模式识别
2025-08-21 v1
摘要
确保自动驾驶的安全是一项复杂的挑战,需要处理未知物体和不可预见的驾驶场景。我们开发了多尺度视频 Transformer,能够仅使用运动线索检测未知物体。视频语义分割和全景分割通常依赖于训练期间见过的已知类别,而忽略了新类别。近期基于大语言模型的视觉定位计算成本高昂,尤其是在像素级输出方面。我们提出了一种高效的视频 Transformer,无需光流即可进行端到端的类别无关分割训练。我们的方法使用多阶段多尺度查询记忆解码和尺度特定的随机丢弃令牌,以确保效率和准确性,并通过共享的可学习记忆模块保持详细的时空特征。与压缩特征的传统解码器不同,我们以记忆为中心的设计在多个尺度上保留了高分辨率信息。我们在 DAVIS'16、KITTI 和 Cityscapes 上进行了评估。我们的方法在 GPU 内存和运行时间方面均表现出色,同时始终优于多尺度基线,为安全关键型机器人技术中的实时、鲁棒密集预测展示了一个有前景的方向。
引用
@article{arxiv.2508.14729,
title = {Multiscale Video Transformers for Class Agnostic Segmentation in Autonomous Driving},
author = {Leila Cheshmi and Mennatullah Siam},
journal= {arXiv preprint arXiv:2508.14729},
year = {2025}
}
备注
6 pages, 2 figures, 1 table