用于常识故事深度理解的语料库与评测框架
计算与语言
2016-04-07 v1 人工智能
摘要
常识知识的表示与学习是实现深度语言理解的基础性问题之一。该问题对于理解事件之间的因果与相关关系尤为具有挑战性。尽管该主题在 NLP 社区引起了大量关注,研究却因缺乏恰当的评测框架而受阻。本文试图通过一种用于评测故事理解与脚本学习的新框架——‘Story Cloze Test’(故事完形填空测试)——来解决此问题。该测试要求系统为四句故事选择正确的结尾。我们创建了包含约 5 万篇五句常识故事的新语料库 ROCStories,以支持该评测。该语料库在两个方面的独特性在于:(1) 它捕捉了日常事件之间丰富的因果与时间常识关系;(2) 它是一个高质量日常生活故事集合,也可用于故事生成。实验评测表明,基于浅层语言理解的大量基线和最先进(state-of-the-art)模型难以在 Story Cloze Test 上取得高分。我们讨论了这些对脚本与故事学习的启示,并为深度语言理解提供了建议。
引用
@article{arxiv.1604.01696,
title = {A Corpus and Evaluation Framework for Deeper Understanding of Commonsense Stories},
author = {Nasrin Mostafazadeh and Nathanael Chambers and Xiaodong He and Devi Parikh and Dhruv Batra and Lucy Vanderwende and Pushmeet Kohli and James Allen},
journal= {arXiv preprint arXiv:1604.01696},
year = {2016}
}
备注
In Proceedings of the 2016 North American Chapter of the ACL (NAACL HLT), 2016