“少即是多”:降低实时多模态助理代理对视障者认知负荷与任务漂移
人机交互
2025-11-04 v1
摘要
视觉语言模型 (VLM) 使即服务视觉助理成为可能,但当前为视障人士 (PVI) 设计的应用存在高认知负荷和任务漂移问题,限制了实际应用价值。我们首先对15名PVI进行形式化研究,识别出视觉助理 (VIA) 的三个关键需求:实时低延迟、最小化认知负荷以及抗幻觉响应以维持信任。基于形式化研究结果,我们构建了 VIA-Agent 原型系统,协同优化其认知“大脑”与交互“身体”。其中,大脑采用目标持久设计并校准简洁性,以产生简短可操作的指导;身体采用实时通信 (RTC) 具象化方案,演变为支持流畅交互的请求-响应模型 Context Protocol (MCP) 流程。我们将 VIA-Agent 与9名PVI在导航与物品检索任务中对比评估了 BeMyAI 和 Doubao。VIA-Agent 在定量和定性指标上均显著优于 BeMyAI。虽然成功率与 Doubao 相当,但其平均任务时间缩短 39.9%(70.1 秒 vs. 110.7 秒),对话轮次减少(4.3 vs. 5.0),并降低了感知认知负荷和任务漂移。系统可用性评估 (SUS) 结果也一致,VIA-Agent 获得了最高的可用性评分。我们希望本工作能激发开发更以人类为中心的 VIA 系统的热情。
引用
@article{arxiv.2511.00945,
title = {"Less is More": Reducing Cognitive Load and Task Drift in Real-Time Multimodal Assistive Agents for the Visually Impaired},
author = {Yi Zhao and Siqi Wang and Qiqun Geng and Erxin Yu and Jing Li},
journal= {arXiv preprint arXiv:2511.00945},
year = {2025}
}
备注
20 pages