FULLER:通过多级梯度校准的统一多模态多任务三维感知
计算机视觉与模式识别
2023-08-01 v1
摘要
在多模态融合与多任务学习因鲁棒预测与计算预算考量正成为三维自动驾驶场景中的趋势。然而,由于众所周知的模态偏置与任务冲突,将现有框架朴素地扩展到多模态多任务学习领域仍然低效甚至有害。先前工作以经验知识手动协调学习框架,可能导致次优解。为缓解该问题,我们提出一种新颖而简单的在优化过程中跨任务与模态的多级梯度校准学习框架。具体而言,由任务头产生并用于更新共享骨干的梯度,将在骨干最后一层被校准以缓解任务冲突。在校准后的梯度进一步传播至骨干的模态分支之前,其幅值将被再次校准至同一水平,确保下游任务对不同模态给予均衡关注。在大规模基准 nuScenes 上的实验证明了所提方法的有效性,例如地图分割上绝对 14.4% mIoU 提升与三维检测上 1.4% mAP 提升,推动了多模态融合与多任务学习领域三维自动驾驶的应用。我们还讨论了模态与任务间的联系。
引用
@article{arxiv.2307.16617,
title = {FULLER: Unified Multi-modality Multi-task 3D Perception via Multi-level Gradient Calibration},
author = {Zhijian Huang and Sihao Lin and Guiyu Liu and Mukun Luo and Chaoqiang Ye and Hang Xu and Xiaojun Chang and Xiaodan Liang},
journal= {arXiv preprint arXiv:2307.16617},
year = {2023}
}