多模态驾驶员指代:车内与车外物体指向的比较
人机交互
2022-02-16 v1 计算机视觉与模式识别
摘要
先进的车内传感技术,尤其是基于视觉的方法,极大地推动了车内用户交互的发展,为自然用户交互的新应用铺平了道路。正如人类使用多种模式相互交流一样,我们遵循一种方法,其特点是为特定任务同时利用多种模态来实现自然的人机交互:指向或注视车内以及车外的物体以进行指示性指代。通过跟踪眼动、头部和手指的运动,我们设计了一个使用深度神经网络的多模态融合架构,以精确识别驾驶员的指代意图。此外,我们使用语音命令作为触发器来分离每个指代事件。我们观察到驾驶员在两种指向用例(即针对车内和车外物体)中的行为差异,特别是在分析眼、头和手指这三种模态的精确性时。我们得出结论,没有一种单一模态对所有情况都是最优的,因为每种模态都显示出某些局限性。多模态融合利用了每种模态的相关特征,从而克服了各单独模态依赖于具体情形的局限性。最终,我们提出了一种基于预测指向方向来识别驾驶员所指物体位于车内还是车外的方法。
引用
@article{arxiv.2202.07360,
title = {Multimodal Driver Referencing: A Comparison of Pointing to Objects Inside and Outside the Vehicle},
author = {Abdul Rafey Aftab and Michael von der Beeck},
journal= {arXiv preprint arXiv:2202.07360},
year = {2022}
}