DAOS:一个包含驾驶员动作-物体协同关系的多模态舱内行为监测数据集
计算机视觉与模式识别
2026-01-21 v1
摘要
在驾驶员活动监测中,动作大多局限于上半身,这使得许多动作看起来很相似。为了区分这些动作,人类通常依赖驾驶员正在使用的物体,例如拿着手机与握方向盘。然而,现有的大多数驾驶员监测数据集缺乏精确的物体位置标注,或者没有将物体与其关联的动作联系起来,这为可靠的动作识别留下了关键空白。为了解决这个问题,我们引入了驾驶员动作与物体协同 (DAOS) 数据集,该数据集包含 9,787 个视频片段,标注了 36 种细粒度驾驶员动作和 15 个物体类别,总计超过 250 万个对应的物体实例。DAOS 提供了来自前、面部、左、右视角的多模态、多视图数据(RGB、IR 和深度)。尽管 DAOS 捕获了广泛的舱内物体,但只有少数物体与每个动作的预测直接相关,因此关注任务特定的人-物关系至关重要。为了应对这一挑战,我们提出了动作-物体关系网络 (AOR-Net)。AOR-Net 通过多级推理和一个动作链提示机制来理解复杂的驾驶员动作,该机制对动作、物体及其关系之间的逻辑关系进行建模。此外,还引入了思维混合模块,以在每个阶段动态选择关键知识,从而增强在物体丰富和物体稀缺条件下的鲁棒性。大量实验表明,我们的模型在各种数据集上优于其他最先进的方法。
引用
@article{arxiv.2601.11990,
title = {DAOS: A Multimodal In-cabin Behavior Monitoring with Driver Action-Object Synergy Dataset},
author = {Yiming Li and Chen Cai and Tianyi Liu and Dan Lin and Wenqian Wang and Wenfei Liang and Bingbing Li and Kim-Hui Yap},
journal= {arXiv preprint arXiv:2601.11990},
year = {2026}
}