中文

使用自动生成的问答对训练 IBM Watson

计算与语言 2016-11-15 v1

摘要

IBM Watson 是一种能够以自然语言进行问答的认知计算系统。据信 IBM Watson 比目前任何其他问答系统都能更有效地理解大型语料库并回答相关问题。然而,要释放 Watson 的全部能力,我们需要用大量精心准备的问答对来训练其实例。显然,手动大量生成此类问答对极其耗时,并严重限制 Watson 的训练效率。最近,有报道称一个包含超过 3000 万问答对的大规模数据集。假设使用这种自动生成的数据集可以减轻手动生成问答对的负担,我们尝试使用该数据集训练一个 Watson 实例,并检查训练效率和准确性。根据我们的实验,使用此自动生成的数据集对训练 Watson 是有效的,是对手工制作的问答对的补充。据作者所知,这项工作是首次尝试使用大规模自动生成问答对数据集来训练 IBM Watson。我们预期从实验中获得的见解和经验教训将对希望利用自动生成问答对加速 Watson 训练的研究人员有用。

关键词

引用

@article{arxiv.1611.03932,
  title  = {Training IBM Watson using Automatically Generated Question-Answer Pairs},
  author = {Jangho Lee and Gyuwan Kim and Jaeyoon Yoo and Changwoo Jung and Minseok Kim and Sungroh Yoon},
  journal= {arXiv preprint arXiv:1611.03932},
  year   = {2016}
}