大型语言模型驱动的车载对话代理的视觉与认知需求
人机交互
2026-01-22 v1 人工智能
摘要
驾驶员分心仍然是机动车碰撞事故的主要诱因,因此需要对新型车载技术进行严格评估。本研究评估了在实际驾驶过程中使用先进的大型语言模型(LLM)对话代理(Gemini Live)所带来的视觉和认知需求,并将其与免提通话、视觉逐步导航(低负荷基线)以及操作广度(OSPAN)任务(高负荷锚点)进行了比较。32名持照驾驶员完成了五项次级任务,同时使用检测响应任务(DRT)测量认知负荷,使用眼动追踪测量视觉注意力,并收集主观工作负荷评分。结果表明,Gemini Live 交互(单轮和多轮)与免提通话的认知负荷水平相似,介于视觉逐步导航和 OSPAN 之间。探索性分析显示,在扩展的多轮对话中认知负荷保持稳定。所有任务的平均注视持续时间均远低于公认的2秒安全阈值,证实了其视觉需求较低。此外,在完成任务期间,驾驶员在瞥向设备的短暂非道路注视之间,始终将更长的注视时间投向道路,尤其是在基于语音的交互中,这使得较长的总视线离开道路时间的发现显得不那么重要。主观评分与客观数据一致,参与者报告 Gemini Live 的努力程度、需求和感知分心均较低。这些发现表明,先进的 LLM 对话代理在通过语音界面实施时,其产生的认知和视觉需求与已确立的低风险免提基准相当,支持其在驾驶环境中的安全部署。
引用
@article{arxiv.2601.15034,
title = {Visual and Cognitive Demands of a Large Language Model-Powered In-vehicle Conversational Agent},
author = {Chris Monk and Allegra Ayala and Christine S. P. Yu and Gregory M. Fitch and Dara Gruber},
journal= {arXiv preprint arXiv:2601.15034},
year = {2026}
}