中文

通过人机合作游戏评估视觉对话智能体

人机交互 2017-08-18 v1 人工智能 计算与语言 计算机视觉与模式识别

摘要

随着 AI 的不断进步,人机团队的出现是不可避免的。然而,AI 的进展通常是在孤立状态下衡量的,没有人类参与其中。对 AI 的进展进行基准测试至关重要,不仅应测试其孤立表现,还应测试其在帮助人类执行特定任务方面的转化效果,即人机团队的性能。在本工作中,我们设计了一款合作游戏——GuessWhich——以在 AI 作为视觉对话智能体的特定情境下衡量人机团队的性能。GuessWhich 涉及人类与 AI 之间的实时交互。我们将其称为 ALICE 的 AI 被提供一张人类不可见的图像。在对图像进行简短描述后,人类向 ALICE 提问关于这张秘密图像的问题,以从固定的图像池中将其识别出来。我们通过人类在与 ALICE 进行固定轮数对话后正确识别出秘密图像所需的猜测次数来衡量人机 ALICE 团队的性能。我们比较了两个版本 ALICE 的人机 ALICE 团队性能。我们的人类研究表明了一个反直觉的趋势:尽管 AI 文献表明,当与 AI 提问机器人配对时,其中一个版本的性能优于另一个版本,但我们发现这种 AI-AI 性能的提升并未转化为人机性能的提升。这表明在孤立状态下对 AI 进行基准测试与在人机团队情境下进行基准测试之间存在不匹配。

关键词

引用

@article{arxiv.1708.05122,
  title  = {Evaluating Visual Conversational Agents via Cooperative Human-AI Games},
  author = {Prithvijit Chattopadhyay and Deshraj Yadav and Viraj Prabhu and Arjun Chandrasekaran and Abhishek Das and Stefan Lee and Dhruv Batra and Devi Parikh},
  journal= {arXiv preprint arXiv:1708.05122},
  year   = {2017}
}

备注

HCOMP 2017