中文

CLUTRR:一个用于文本归纳推理的诊断基准

机器学习 2019-09-05 v2 计算与语言 计算机科学中的逻辑 机器学习

摘要

自然语言理解(NLU)系统近期的成功一直受到一些结果的困扰,这些结果突显了这些模型无法以系统且鲁棒的方式泛化。在这项工作中,我们引入了一个名为 CLUTRR 的诊断基准套件,以澄清与 NLU 系统的鲁棒性和系统性相关的一些关键问题。受归纳逻辑编程经典工作的启发,CLUTRR 要求 NLU 系统推断短篇故事中人物之间的亲属关系。在该任务上取得良好表现既需要提取实体之间的关系,也需要推断支配这些关系的逻辑规则。CLUTRR 通过在与训练时不同的逻辑规则组合上评估,使我们能够精确衡量模型的系统泛化能力;并且它通过添加精心设计的噪声事实,使我们能够评估模型的鲁棒性。我们的实证结果突显了最先进的 NLU 模型(例如 BERT 和 MAC)与一个直接处理符号输入的图神经网络模型之间的显著性能差距——基于图的模型展现出更强的泛化能力和更高的鲁棒性。

关键词

引用

@article{arxiv.1908.06177,
  title  = {CLUTRR: A Diagnostic Benchmark for Inductive Reasoning from Text},
  author = {Koustuv Sinha and Shagun Sodhani and Jin Dong and Joelle Pineau and William L. Hamilton},
  journal= {arXiv preprint arXiv:1908.06177},
  year   = {2019}
}

备注

Accepted at EMNLP 2019, 9 page content + Appendix