Watson 玩《Jeopardy!》的策略分析
人工智能
2014-02-05 v1
摘要
IBM Watson 要在《Jeopardy!》节目中达到冠军水平,需要在问答技术方面取得重大突破——该节目要求对具有挑战性的自然语言问题进行快速回答,具备广泛的常识知识、高精度以及准确的置信度估计。此外,《Jeopardy!》包含四种具有重大战略意义的决策类型:(1) 每日双倍 (Daily Double) 下注;(2) 最终 Jeopardy (Final Jeopardy) 下注;(3) 控制棋盘时选择下一个方格;(4) 决定是否尝试回答,即“抢答”。与简单的“经验法则”策略相比,采用能够恰当考虑游戏状态和未来事件概率的复杂策略,可以显著提高玩家的整体获胜几率。本文介绍了我们开发 Watson 游戏策略的方法,包括构建一个高保真模拟模型,然后在模拟器中使用学习和蒙特卡洛 (Monte-Carlo) 方法来优化 Watson 的战略决策。在详细描述每种游戏策略算法后,我们重点验证了模拟器预测的准确性,并记录了使用我们方法带来的性能提升。相对于简单的启发式策略以及历史剧集中实际人类参赛者的表现,本文展示了量化的性能收益。我们进一步扩展了对人类博弈的分析,推导出一系列有价值且反直觉的示例,说明人类参赛者如何提升其在节目中的表现。
引用
@article{arxiv.1402.0571,
title = {Analysis of Watson's Strategies for Playing Jeopardy!},
author = {Gerald Tesauro and David C. Gondek and Jonathan Lenchner and James Fan and John M. Prager},
journal= {arXiv preprint arXiv:1402.0571},
year = {2014}
}