从场景到目标:文本引导的双重注视预测
计算机视觉与模式识别
2026-04-29 v2 人工智能
机器人学
摘要
可解释的驾驶员注意力预测对于实现类人自动驾驶至关重要。然而,现有数据集仅提供场景级全局注视,而非细粒度的目标级标注,这从根本上无法支持基于文本的认知建模。因此,尽管视觉-语言模型(VLM)在语义推理方面潜力巨大,但这一关键数据限制导致了严重的文本-视觉解耦和视觉偏差幻觉。为突破此瓶颈并实现精确的目标级注意力预测,本文提出了一种新颖的双分支注视预测框架,建立了从数据构建到模型架构的完整范式。首先,我们构建了 G-W3DA,一个目标级驾驶员注意力数据集。通过将多模态大语言模型与 Segment Anything Model 3(SAM3)相结合,我们在严格的交叉验证下将宏观热力图解耦为目标级掩码,从根本上消除了标注幻觉。基于这一高质量数据基础,我们提出了 DualGaze-VLM 架构。该架构提取语义查询的隐藏状态,并通过条件感知 SE-Gate 动态调制视觉特征,实现了意图驱动的精确空间锚定。在 W3DA 基准上的大量实验表明,DualGaze-VLM 在空间对齐指标上持续超越现有最先进(SOTA)模型,尤其是在安全攸关场景下,相似度(SIM)指标最高提升了 17.8%。此外,一项视觉图灵测试揭示,DualGaze-VLM 生成的注意力热图被 88.22% 的人类评估者认为是真实的,证明了其生成合理认知先验的能力。
引用
@article{arxiv.2604.20191,
title = {From Scene to Object: Text-Guided Dual-Gaze Prediction},
author = {Zehong Ke and Yanbo Jiang and Jinhao Li and Zhiyuan Liu and Yiqian Tu and Qingwen Meng and Heye Huang and Jianqiang Wang},
journal= {arXiv preprint arXiv:2604.20191},
year = {2026}
}