SherLIiC:用于评估自然语言推理的 typed 事件聚焦型词汇推理基准
计算与语言
2019-06-05 v1 人工智能
摘要
我们提出 SherLIiC,一个面向语境中词汇推理(LIiC)的测试平台,包含 3985 条人工标注的推理规则候选(InfCands),并附带(i)约 96 万条未标注 InfCands,以及(ii)从大型实体链接语料库 ClueWeb09 中提取的约 19 万条 Freebase 实体间的 typed 文本关系。每条 InfCand 由这些关系之一(表述为词形还原的依赖路径)与两个论元占位符组成,每个占位符链接到一个或多个 Freebase 类型。由于我们的候选筛选过程基于强分布证据,SherLIiC 比现有测试平台困难得多,因为分布证据在 InfCand 分类中效用甚微。我们还表明,由于其构建方式,SherLIiC 中许多正确 InfCand 是新颖的且未被现有规则库收录。我们在 SherLIiC 上评估了若干强基线,从语义向量空间模型到最先进的自然语言推理(NLI)神经模型。我们表明 SherLIiC 对现有 NLI 系统构成了严峻挑战。
引用
@article{arxiv.1906.01393,
title = {SherLIiC: A Typed Event-Focused Lexical Inference Benchmark for Evaluating Natural Language Inference},
author = {Martin Schmitt and Hinrich Schütze},
journal= {arXiv preprint arXiv:1906.01393},
year = {2019}
}
备注
Accepted as a long paper to ACL 2019