中文

导航图灵测试(NTT):学习评估类人导航

人工智能 2021-07-29 v2 机器学习

摘要

在开发学习复杂类人行为的智能体的道路上,一个关键挑战是需要快速且准确地量化类人程度。尽管人类对此类行为的评估可高度准确,但速度与可扩展性有限。我们通过一种新颖的自动化导航图灵测试(ANTT)来解决这些局限,该测试学习预测人类对类人程度的判断。我们在一个复杂3D环境中的导航任务上展示了自动化NTT的有效性。我们研究了六种分类模型以阐明最适合该任务的架构类型,并针对通过人类NTT收集的数据对它们进行验证。我们的最佳模型在区分真实人类与智能体行为时达到高准确率。同时,我们表明预测对智能体朝类人行为进展的更细粒度人类评估仍未被解决。我们的工作朝着更有效地学习复杂类人行为的智能体迈出了重要一步。

关键词

引用

@article{arxiv.2105.09637,
  title  = {Navigation Turing Test (NTT): Learning to Evaluate Human-Like Navigation},
  author = {Sam Devlin and Raluca Georgescu and Ida Momennejad and Jaroslaw Rzepecki and Evelyn Zuniga and Gavin Costello and Guy Leroy and Ali Shaw and Katja Hofmann},
  journal= {arXiv preprint arXiv:2105.09637},
  year   = {2021}
}

备注

All data collected throughout this study, plus the code to reproduce our analysis and ANTT are available at https://github.com/microsoft/NTT