用于评估自然语言推理中复杂组合知识的合成数据集
计算与语言
2025-10-21 v4
摘要
我们引入一个名为涉及复杂组合知识的句子(Sentences Involving Complex Compositional Knowledge, SICCK)的合成数据集,以及一项新颖的分析,考察自然语言推理(NLI)模型在理解逻辑组合性方面的表现。我们通过修改 SICK 数据集(Marelli 等,2014)中的 15 个样例生成了 1,304 个句子对。为此,我们使用一组短语——对应于自然逻辑(Natural Logic, NL)(MacCartney, 2009)中全称量词、存在量词、否定及其他概念修饰符的修饰语——来修改原始文本。我们利用这些短语修改前提与假设的主语、动词和宾语部分。最后,依据 NL 规则为这些修改后的文本标注相应的蕴含标签。我们在零样本与微调两种场景下,对神经 NLI 模型在多大程度上捕捉到结构与语义组合的变化进行了初步验证。我们发现,NLI 模型在零样本设定下表现不佳,尤其对于带否定与存在量词的修改句。在使用该数据集微调后,我们观察到模型在否定、存在与全称修饰符上仍表现不佳。
引用
@article{arxiv.2307.05034,
title = {Synthetic Dataset for Evaluating Complex Compositional Knowledge for Natural Language Inference},
author = {Sushma Anand Akoju and Robert Vacareanu and Haris Riaz and Eduardo Blanco and Mihai Surdeanu},
journal= {arXiv preprint arXiv:2307.05034},
year = {2025}
}
备注
Accepted to Natural Language Reasoning and Structured Explanations (NLRSE) Workshop, ACL 2023. For dataset, please refer https://github.com/sushmaakoju/clulab-releases/blob/master/acl2023-nlrse-sicck/README.md and https://github.com/sushmaanandakoju/acl2023-nlrse-clulab-SICCK-dataset