TEM^3-学习:面向先进驾驶辅助的高效多模态多任务学习
计算机视觉与模式识别
2025-06-24 v1
摘要
多任务学习(MTL)可通过共享表示探索任务间关联性,推动驾驶辅助系统的发展。然而,现有方法面临两个关键局限:单模态约束限制了全面场景理解,以及低效架构阻碍了实时部署。本文提出TEM^3-学习(Time-Efficient Multimodal Multi-task Learning),一种新型框架,通过两阶段架构联合优化司机情感识别、司机行为识别、交通环境识别和车辆行为识别。第一组件是基于Mamba的多视角时空特征提取子网络(MTS-Mamba),引入前向-后向时序扫描机制和全局-局部空间注意力,高效提取多视角序列图像的低成本时空特征。第二组件是MTL基的门控多模态特征集成器(MGMI),采用任务特定的多门控模块,自适应突出显示每个任务最相关的模态特征,有效缓解MTL中的负迁移问题。在AIDE数据集上,我们的模型在所有四个任务上实现了最先进的准确率,保持轻量级架构,参数不足600万,实现惊人的142.32 FPS的推理速度。严格的消融研究进一步验证了该框架的有效性以及每个模块的独立贡献。代码已公开于https://github.com/Wenzhuo-Liu/TEM3-Learning。
引用
@article{arxiv.2506.18084,
title = {TEM^3-Learning: Time-Efficient Multimodal Multi-Task Learning for Advanced Assistive Driving},
author = {Wenzhuo Liu and Yicheng Qiao and Zhen Wang and Qiannan Guo and Zilong Chen and Meihua Zhou and Xinran Li and Letian Wang and Zhiwei Li and Huaping Liu and Wenshuo Wang},
journal= {arXiv preprint arXiv:2506.18084},
year = {2025}
}