CONFER:用于评估自然语言推理模型在条件推理和前提推理方面能力的数据集
计算与语言
2025-06-09 v1
摘要
自然语言推理(NLI)是确定句子对是否表示蕴含、矛盾或中性关系的任务。尽管NLI模型在许多推理任务中表现良好,但其处理细粒度语用推理——尤其是条件句中的前提推理——仍未得到充分探索。本研究引入CONFER,一个 novel 用于评估NLI模型处理条件句推理的数据集。我们评估了四个NLI模型,包括两个预训练模型,以检验其在条件推理上的泛化能力。此外,我们评估了大型语言模型(LLMs),包括GPT-4o、LLaMA、Gemma和DeepSeek-R1,在零样本和few-shot提示设置下分析其推理前提的能力。我们的发现表明,NLI模型在条件中的前提推理方面存在困难,针对现有NLI数据集的微调并不一定能提高其性能。
引用
@article{arxiv.2506.06133,
title = {Let's CONFER: A Dataset for Evaluating Natural Language Inference Models on CONditional InFERence and Presupposition},
author = {Tara Azin and Daniel Dumitrescu and Diana Inkpen and Raj Singh},
journal= {arXiv preprint arXiv:2506.06133},
year = {2025}
}
备注
This paper is published in the Proceedings of the 38th Canadian Conference on Artificial Intelligence (CAIAC 2025). Please cite the conference version at https://caiac.pubpub.org/pub/keh8ij01