MMTL-UniAD:面向驾驶辅助感知的统一多模态多任务学习框架
计算机视觉与模式识别
2025-04-04 v1
摘要
驾驶员辅助系统需要全面理解驾驶员的心理/生理状态和交通背景,但现有研究常忽视这些任务之间联合学习的潜在益处。本文提出了MMTL-UniAD,一个统一的多模态多任务学习框架,同时识别驾驶员行为(如视角转移、说话)、驾驶员情绪(如焦虑、快乐)、车辆行为(如停车、转向)以及交通背景(如交通拥堵、交通顺畅)。一个关键挑战是避免任务之间的负迁移,这可能影响学习性能。为此,我们在框架中引入了两个关键组件:一个是多轴区域注意力网络,用于提取全局上下文敏感特征;另一个是双分支多模态嵌入,从任务共享特征和任务特定特征中学习多模态嵌入。前者使用多注意力机制提取任务相关特征,缓解由任务无关特征引起的负迁移;后者采用双分支结构,自适应调整任务共享和任务特定参数,增强跨任务知识迁移,同时减少任务冲突。我们在AIDE数据集上评估了MMTL-UniAD,通过一系列消融实验,证明其在所有四个任务上均优于当前最先进的方法。代码已公开于 https://github.com/Wenzhuo-Liu/MMTL-UniAD。
引用
@article{arxiv.2504.02264,
title = {MMTL-UniAD: A Unified Framework for Multimodal and Multi-Task Learning in Assistive Driving Perception},
author = {Wenzhuo Liu and Wenshuo Wang and Yicheng Qiao and Qiannan Guo and Jiayin Zhu and Pengfei Li and Zilong Chen and Huiming Yang and Zhiwei Li and Lening Wang and Tiao Tan and Huaping Liu},
journal= {arXiv preprint arXiv:2504.02264},
year = {2025}
}