中文

视觉同盟:通过人类-人工智能协作中的共享第一人称视角实现认知对齐

人机交互 2026-03-16 v1 人工智能

摘要

尽管多模态人工智能取得了进展,当前基于视觉的助手在协作任务中仍显得效率低下。我们识别了两个关键鸿沟:一种是沟通鸿沟,用户必须将丰富的平行意图转化为语言命令,而由于信道不匹配;另一种是理解鸿沟,人工智能难以解释细微的具身线索。为此,我们提出了 Eye2Eye 框架,通过第一人称视角作为人类-人工智能认知对齐的信道。它集成了三个组件:(1) 联合注意力协调以实现流畅的焦点对齐,(2) 可 revisable 记忆以维持不断变化的共同基础,(3) 反思性反馈允许用户澄清和细化人工智能的理解。我们在 AR 原型中实现了该框架,并通过用户研究和事后管道评估进行评估。结果表明,Eye2Eye 在显著减少任务完成时间和交互负荷的同时,提升了信任度,证明了其各组件协同工作以改善协作效果。

关键词

引用

@article{arxiv.2603.12701,
  title  = {Seeing Eye to Eye: Enabling Cognitive Alignment Through Shared First-Person Perspective in Human-AI Collaboration},
  author = {Zhuyu Teng and Pei Chen and Yichen Cai and Ruoqing Lu and Zhaoqu Jiang and Jiayang Li and Weitao You and Lingyun Sun},
  journal= {arXiv preprint arXiv:2603.12701},
  year   = {2026}
}

备注

19 pages, 11 figures. Accepted at ACM CHI 2026, Barcelona