中文

“少即是多”:降低实时多模态助理代理对视障者认知负荷与任务漂移

人机交互 2025-11-04 v1

摘要

视觉语言模型 (VLM) 使即服务视觉助理成为可能,但当前为视障人士 (PVI) 设计的应用存在高认知负荷和任务漂移问题,限制了实际应用价值。我们首先对15名PVI进行形式化研究,识别出视觉助理 (VIA) 的三个关键需求:实时低延迟、最小化认知负荷以及抗幻觉响应以维持信任。基于形式化研究结果,我们构建了 VIA-Agent 原型系统,协同优化其认知“大脑”与交互“身体”。其中,大脑采用目标持久设计并校准简洁性,以产生简短可操作的指导;身体采用实时通信 (RTC) 具象化方案,演变为支持流畅交互的请求-响应模型 Context Protocol (MCP) 流程。我们将 VIA-Agent 与9名PVI在导航与物品检索任务中对比评估了 BeMyAI 和 Doubao。VIA-Agent 在定量和定性指标上均显著优于 BeMyAI。虽然成功率与 Doubao 相当,但其平均任务时间缩短 39.9%(70.1 秒 vs. 110.7 秒),对话轮次减少(4.3 vs. 5.0),并降低了感知认知负荷和任务漂移。系统可用性评估 (SUS) 结果也一致,VIA-Agent 获得了最高的可用性评分。我们希望本工作能激发开发更以人类为中心的 VIA 系统的热情。

关键词

引用

@article{arxiv.2511.00945,
  title  = {"Less is More": Reducing Cognitive Load and Task Drift in Real-Time Multimodal Assistive Agents for the Visually Impaired},
  author = {Yi Zhao and Siqi Wang and Qiqun Geng and Erxin Yu and Jing Li},
  journal= {arXiv preprint arXiv:2511.00945},
  year   = {2025}
}

备注

20 pages