中文

CREAK:一个面向实体知识常识推理的数据集

计算与语言 2021-09-06 v1 人工智能

摘要

大多数针对常识推理的基准数据集聚焦于日常场景:如知道可在瀑布下装满杯子的物理知识 [Talmor et al., 2019]、撞到别人很尴尬的社交知识 [Sap et al., 2019],以及其他通用情境。然而,存在一片丰富的常识推断空间,其锚定于关于特定实体的知识:例如,判定断言“Harry Potter 可以教如何用扫帚飞行的课”的真伪。模型能否学会以这种方式将实体知识与常识推理结合?我们引入 CREAK,一个关于实体知识的常识推理测试平台,将关于实体的事实核查(Harry Potter 是巫师且擅长骑扫帚)与常识推断(若你擅长某项技能便可教他人)相桥接。我们的数据集包含 13k 条由人工撰写的关于实体的英文断言,其为真或假,此外还有一个小型对比集。众包工作者可轻松给出这些陈述,且人在该数据集上表现很高(90 多分);我们认为模型应能融合实体知识与常识推理以在此表现良好。在我们的实验中,我们聚焦于闭卷设定,并观察到在现有事实验证基准上微调的基线模型在 CREAK 上表现不佳。在 CREAK 上训练模型将准确率大幅提升,但仍未达人类水平。我们的基准对自然语言理解模型提供了独特探针,测试其检索事实(例如,谁在芝加哥大学任教?)与未言明常识知识(例如,管家不会对客人吼叫)的能力。

关键词

引用

@article{arxiv.2109.01653,
  title  = {CREAK: A Dataset for Commonsense Reasoning over Entity Knowledge},
  author = {Yasumasa Onoe and Michael J. Q. Zhang and Eunsol Choi and Greg Durrett},
  journal= {arXiv preprint arXiv:2109.01653},
  year   = {2021}
}