面向实时通用多任务的 You Only Look at Once
计算机视觉与模式识别
2024-04-26 v4
摘要
高精度、轻量化和实时响应是自动驾驶落地的三个核心需求。本研究提出 A-YOLOM,一种自适应、实时且轻量的多任务模型,旨在同时处理目标检测、可行驶区域分割与车道线分割任务。具体而言,我们构建了一个具有统一精简分割结构的端到端多任务模型。我们引入可学习参数,在分割任务中自适应地拼接 neck 与 backbone 之间的特征,并对所有分割任务使用同一损失函数。这消除了定制化的需要并增强了模型的泛化能力。我们还引入了仅由一系列卷积层组成的分割头,减少了参数量与推理时间。我们在 BDD100k 数据集上取得了具有竞争力的结果,尤其在可视化效果上。性能结果显示:目标检测 mAP50 为 81.1%,可行驶区域分割 mIoU 为 91.0%,车道线分割 IoU 为 28.8%。此外,我们引入真实场景以评估模型在实际场景中的表现,其显著优于竞争对手。这表明我们的模型不仅具有竞争力,而且比现有多任务模型更灵活、更快速。源代码与预训练模型发布于 https://github.com/JiayuanWang-JW/YOLOv8-multi-task
引用
@article{arxiv.2310.01641,
title = {You Only Look at Once for Real-time and Generic Multi-Task},
author = {Jiayuan Wang and Q. M. Jonathan Wu and Ning Zhang},
journal= {arXiv preprint arXiv:2310.01641},
year = {2024}
}