中文

开放域对话系统的评估与比较

计算与语言 2018-12-31 v2 人工智能 计算机与社会 人机交互 多智能体系统

摘要

对话代理正迅速普及。然而,尽管近年来研究兴趣显著增长,在非目标导向对话领域仍有大量工作有待开展。为推动对话式人工智能的技术水平,亚马逊发起了 Alexa Prize,一项 250 万美元的大学竞赛,十六支入选大学团队构建了对话代理以提供更佳的社交对话体验。Alexa Prize 为学术界提供了使用被数百万用户使用的实时系统进行研究的独特机会。评估对话所关联的主观性是构建非目标导向对话系统挑战背后的关键因素。在本文中,我们提出了一种综合评估策略,采用多种指标,通过选取与人类判断高度相关的指标来降低主观性。所提出的指标提供了对对话代理的细粒度分析,这是人类评分所未能捕捉的。我们表明这些指标可作为人类判断的合理替代。我们提供了一种统一这些指标以遴选最优代理的机制,该机制也已在 Alexa Prize 竞赛中全程应用。据我们所知,迄今为止这是规模最大的评估代理的设置,包含数百万次对话及数十万条用户评分。我们认为本工作是迈向对话式 AI 自动评估过程的一步。

关键词

引用

@article{arxiv.1801.03625,
  title  = {On Evaluating and Comparing Open Domain Dialog Systems},
  author = {Anu Venkatesh and Chandra Khatri and Ashwin Ram and Fenfei Guo and Raefer Gabriel and Ashish Nagar and Rohit Prasad and Ming Cheng and Behnam Hedayatnia and Angeliki Metallinou and Rahul Goel and Shaohua Yang and Anirudh Raju},
  journal= {arXiv preprint arXiv:1801.03625},
  year   = {2018}
}

备注

10 pages, 5 tables. NIPS 2017 Conversational AI workshop. http://alborz-geramifard.com/workshops/nips17-Conversational-AI/Main.html