中文

(计算机)视觉在行动:比较远程视力辅助与多模态语音代理在检查序列中的表现

人机交互 2026-02-06 v1

摘要

人机辅助是否以与人-人辅助相同的方式展开?本研究探讨可以从盲人个体和视力正常志愿者的专业知识中学到什么,以指导多模态语音代理的设计,并解决长期存在的主动性问题。基于对更大语料库中两个代表性片段的精细分析,我们对比了一位经验丰富的人类远程视力辅助者与一位盲人参与者在电话中协作寻找毯子上污渍时共同产生的实践,与同一参与者稍早前与多模态语音代理在相同任务上合作时实现的实践。这种比较使我们能够精确地指定代理在现场未能实施哪些基本的主动实践。我们得出结论,只要多模态语音代理无法产生由环境触发的基于视觉的行动,它们就会缺乏人类远程视力辅助者所依赖的关键资源。

关键词

引用

@article{arxiv.2602.05671,
  title  = {(Computer) Vision in Action: Comparing Remote Sighted Assistance and a Multimodal Voice Agent in Inspection Sequences},
  author = {Damien Rudaz and Barbara Nino Carreras and Sara Merlino and Brian L. Due and Barry Brown},
  journal= {arXiv preprint arXiv:2602.05671},
  year   = {2026}
}

备注

Conditionally accepted at CHI 2026, 32 pages, 8 figures