中文

用语言模型平滑蕴含图

计算与语言 2023-09-25 v2

摘要

语料库中自然语言谓词的多样性和齐夫频率分布导致通过开放关系抽取(ORE)构建的蕴含图(EGs)存在稀疏性。EGs 是自然语言推理中计算高效且可解释的模型,但作为符号模型,若测试时缺失新颖的前提或假设顶点,它们便会失效。我们提出克服符号模型中此类稀疏性的理论与方法。首先,我们引入通过构建传递链对 EGs 进行最优平滑的理论。然后,我们展示一种高效、开放领域且无监督的平滑方法,使用现成的语言模型来寻找缺失前提谓词的近似。这在两个困难的定向蕴含数据集上分别将召回率提高了 25.1 和 16.3 个百分点,同时提升了平均精度并保持模型可解释性。此外,在问答任务中,我们表明 EG 平滑对于支持文本较少、缺失前提谓词代价更高的问题最为有用。最后,使用 WordNet 的受控实验验证了我们的理论,并表明假设平滑虽困难但在原则上是可行的。

关键词

引用

@article{arxiv.2208.00318,
  title  = {Smoothing Entailment Graphs with Language Models},
  author = {Nick McKenna and Tianyi Li and Mark Johnson and Mark Steedman},
  journal= {arXiv preprint arXiv:2208.00318},
  year   = {2023}
}

备注

Published at AACL 2023