基于 YOLOR 的多任务学习
计算机视觉与模式识别
2023-10-02 v1
摘要
多任务学习(MTL)旨在使用单一模型学习多个任务,并基于泛化与共享语义的假设联合改进所有任务。在联合学习中减少任务间冲突十分困难,通常需细致的网络设计与极大的模型。我们提出基于 You Only Learn One Representation(YOLOR)构建,这是一种专为多任务设计的网络架构。YOLOR 利用显式与隐式知识(分别来自数据观测与习得隐变量)以改进共享表征,同时最小化训练参数量。然而,YOLOR 及其后续 YOLOv7 仅同时训练两个任务。本文中,我们联合训练目标检测、实例分割、语义分割与图像描述。我们分析权衡并试图最大化语义信息共享。通过我们的架构与训练策略,我们发现该方法在所有任务上取得具竞争力的性能,同时保持低参数量且无需任何预训练。我们将很快发布代码。
引用
@article{arxiv.2309.16921,
title = {YOLOR-Based Multi-Task Learning},
author = {Hung-Shuo Chang and Chien-Yao Wang and Richard Robert Wang and Gene Chou and Hong-Yuan Mark Liao},
journal= {arXiv preprint arXiv:2309.16921},
year = {2023}
}