Quizbowl:增量式问答的案例
计算与语言
2021-02-15 v2
摘要
学术问答竞赛通过对问答的掌握来检验知识与智能。现代问答基准是图灵测试的一种变体。具体而言,达到与人类相当的水平回答问题,是迈向展示类人智能的最低门槛。本文提出,某一竞赛的形式——参与者可以在听到问题中间时作答(增量式)——能更好地区分(人类或机器)玩家之间的技巧。此外,将顺序决策子任务与问答(QA)相结合,为模型校准与对手建模研究提供了良好环境。因此,该任务中蕴含三个机器学习挑战:(1)面向数千个类维基百科答案的事实型问答,(2)QA模型置信度分数的校准,以及(3)融合QA模型知识、其校准情况与对手可能行为的顺序决策。我们做出两点贡献:(1)收集并整理了一个大型事实型问答数据集及配套的博弈数据集,(2)开发了一个应对这三个机器学习挑战的模型。除离线评估外,我们还让该模型与世界上一些最杰出的问答玩家在跨越数年的系列表演赛中对弈。本文通篇表明,与活跃的问答社区的协作提升了我们数据集的质量,催生了新的研究方向,并作为吸引公众参与机器学习与自然语言处理研究的激动人心的方式。
引用
@article{arxiv.1904.04792,
title = {Quizbowl: The Case for Incremental Question Answering},
author = {Pedro Rodriguez and Shi Feng and Mohit Iyyer and He He and Jordan Boyd-Graber},
journal= {arXiv preprint arXiv:1904.04792},
year = {2021}
}