UV-M3TL:面向助理驾驶感知的统一且通用的多模态多任务学习框架
计算机视觉与模式识别
2026-02-03 v1
摘要
高级驾驶辅助系统(ADAS)需要理解人类驾驶员的行为,同时感知其导航环境,但联合学习这些异构任务会导致任务间负迁移,影响系统性能。本文提出一种统一且通用的多模态多任务学习(UV-M3TL)框架,以同时识别驾驶员行为、驾驶员情绪、车辆行为和交通环境,同时缓解任务间负迁移。我们的框架包含两个核心组件:双分支空间通道多模态嵌入(DB-SCME)和自适应特征解耦多任务损失(AFD-Loss)。DB-SCME通过采用双分支结构显式建模关键任务共享特征和任务特定特征,以增强跨任务知识迁移并缓解任务冲突。AFD-Loss通过引入基于学习动态和特征解耦约束的自适应加权机制,提高了联合优化的稳定性,同时引导模型学习多样化的多任务表示。我们在AIDE数据集上评估了本方法,实验结果表明,UV-M3TL在所有四个任务上均实现了最先进的性能。为进一步证明其通用性,我们在额外的公共多任务感知基准数据集(BDD100K、CityScapes、NYUD-v2和PASCAL-Context)上评估了UV-M3TL,在各种任务组合下均能稳健地获得优异的性能,在大多数任务上实现了最先进的成果。
引用
@article{arxiv.2602.01594,
title = {UV-M3TL: A Unified and Versatile Multimodal Multi-Task Learning Framework for Assistive Driving Perception},
author = {Wenzhuo Liu and Qiannan Guo and Zhen Wang and Wenshuo Wang and Lei Yang and Yicheng Qiao and Lening Wang and Zhiwei Li and Chen Lv and Shanghang Zhang and Junqiang Xi and Huaping Liu},
journal= {arXiv preprint arXiv:2602.01594},
year = {2026}
}