FSDAM: 基于视觉-语言耦合的少样本驾驶注意力建模
计算机视觉与模式识别
2026-03-16 v2
摘要
理解驾驶员看向何处以及注意力为何转移,对于自动驾驶中可解释的人机协作至关重要。驾驶员注意力并非纯粹的感知过程,而是具有语义结构。因此,注意力转移可以通过极少的语义监督而非密集的大规模标注来学习。我们提出了 FSDAM(Few-Shot Driver Attention Modeling),一个仅使用 90 个标注示例即可实现联合空间注意力预测和结构化解释生成的框架。我们的关键见解是将注意力分解为显式的推理表示,包括场景上下文、当前焦点、预期下一焦点和因果解释,并通过最小对监督来学习下一焦点预测。为了解决现有模型的任务冲突和大样本需求,并在有限数据下缓解任务干扰,我们引入了一种新颖的双路径架构,其中独立的模块分别处理空间预测和描述生成。此外,我们使用一种仅用于训练的视觉-语言对齐机制,将语义先验注入空间学习,而不增加推理复杂度,从而在少样本训练下缓解任务干扰。尽管数据极度稀缺,FSDAM 在注视预测中仍取得了有竞争力的性能,并生成了连贯且上下文感知的结构化推理,以提高可解释性。该模型在多个驾驶基准测试中进一步展示了强大的零样本泛化能力。
引用
@article{arxiv.2511.12708,
title = {FSDAM: Few-Shot Driving Attention Modeling via Vision-Language Coupling},
author = {Kaiser Hamid and Can Cui and Khandakar Ashrafi Akbar and Ziran Wang and Nade Liang},
journal= {arXiv preprint arXiv:2511.12708},
year = {2026}
}