RMT-PPAD:面向自动驾驶的实时多任务学习全景感知
计算机视觉与模式识别
2025-08-12 v1 机器学习
摘要
自动驾驶系统依赖全景驾驶感知,要求兼具精度与实时性能。本文提出RMT-PPAD,一个实时基于Transformer的多任务模型,联合执行目标检测、可驾区域分割和车道线分割。我们引入轻量级模块,采用门控控制带适配器的方式,自适应融合共享特征与任务特定特征,有效缓解任务间的负迁移。此外,我们设计了自适应分割解码器,在训练阶段自动学习多尺度特征的权重,避免为不同分割任务手动设计任务特定结构。我们还识别并解决了车道线分割中训练与测试标签不一致的问题,确保更公平的评估。在BDD100K数据集上进行实验,RMT-PPAD实现了状态最佳性能:目标检测的mAP50为84.9%,召回率为95.4%,可驾区域分割的mIoU为92.6%,车道线分割的IoU为56.8%,准确率为84.7%。推理速度达到32.6 FPS。此外,我们引入实际场景评估RMT-PPAD的实际性能,结果表明RMT-PPAD持续提供稳定性能。源代码和预训练模型已发布于https://github.com/JiayuanWang-JW/RMT-PPAD。
引用
@article{arxiv.2508.06529,
title = {RMT-PPAD: Real-time Multi-task Learning for Panoptic Perception in Autonomous Driving},
author = {Jiayuan Wang and Q. M. Jonathan Wu and Katsuya Suto and Ning Zhang},
journal= {arXiv preprint arXiv:2508.06529},
year = {2025}
}