中文

KITMUS 测试:评估自然语言理解系统中多源知识整合能力

计算与语言 2023-05-24 v2 机器学习

摘要

许多最先进的自然语言理解(NLU)模型基于预训练神经语言模型。这些模型常利用来自多个来源的信息进行推断。此类推断的一个重要类别是那些既需要背景知识( presumably 包含于模型预训练参数中),又需要推理时提供的特定实例信息的推断。然而,NLU 模型在存在多知识源情况下的整合与推理能力在很大程度上未被充分研究。在本工作中,我们提出了一套需要基于多事实推理的共指消解子任务测试集。这些子任务在所包含相关事实的知识源方面有所不同。我们还引入了仅在使用虚构知识的推理时呈现知识的子任务。我们在我们的数据集上评估了最先进的共指消解模型。结果表明,若干模型难以对预训练时和推理时均观察到的知识进行即时推理。然而,通过任务特定训练,一部分模型展现出从多源整合特定知识类型的能力。即便如此,即便性能最佳的模型似乎也难以可靠地整合仅在推理时呈现的知识。

关键词

引用

@article{arxiv.2212.08192,
  title  = {The KITMUS Test: Evaluating Knowledge Integration from Multiple Sources in Natural Language Understanding Systems},
  author = {Akshatha Arodi and Martin Pömsl and Kaheer Suleman and Adam Trischler and Alexandra Olteanu and Jackie Chi Kit Cheung},
  journal= {arXiv preprint arXiv:2212.08192},
  year   = {2023}
}

备注

Accepted at ACL 2023. Code available at https://github.com/mpoemsl/kitmus