中文

LoNLI:用于测试 NLI 多样化逻辑推理能力的可扩展框架

人工智能 2023-09-06 v2

摘要

自然语言推理 (NLI) 被认为是测试自然语言理解 (NLU) 的代表性任务。在这项工作中,我们提出了一个可扩展的框架,以分类的方式集体测试 NLI(以及扩展的 NLU)所需的各种逻辑推理能力。受行为测试启发,我们创建了一个半合成的大型测试平台(363 个模板,363k 个示例)和一个相关联的框架,该框架提供以下实用功能:1) 沿 17 个推理维度(包括语用推理)单独测试和分析推理能力;2) 设计实验以研究跨能力信息内容(留一法或引入法);3) 合成性质使我们能够控制伪影和偏差。我们扩展了一个公开可用的自动化测试用例实例化框架,该框架从自由格式自然语言模板 和明确定义的能力分类法出发,通过改变自然语言的复杂性,覆盖了广泛且难度不断增加的测试用例。通过对最先进的 NLI 系统的分析,我们观察到我们的基准确实很困难(即使在额外资源上进行训练也并非微不足道)。某些能力显得尤为困难。此外,细粒度分析和微调实验揭示了关于这些能力和模型的更多见解——支持并扩展了先前的观察结果;从而展示了所提出测试平台的实用性。

关键词

引用

@article{arxiv.2112.02333,
  title  = {LoNLI: An Extensible Framework for Testing Diverse Logical Reasoning Capabilities for NLI},
  author = {Ishan Tarunesh and Somak Aditya and Monojit Choudhury},
  journal= {arXiv preprint arXiv:2112.02333},
  year   = {2023}
}

备注

arXiv admin note: substantial text overlap with arXiv:2107.07229