自然语言推理中的参考确定性问题探析
计算与语言
2025-02-11 v1
摘要
我们重新审视了自然语言推理(NLI)任务中参考确定性(RD)假设,即假设前提和假设指代相同的上下文。虽然RD假设在构建新NLI数据集时具有实用性,但我们注意到当前NLI模型——通常仅在RD假设下创建的假设-前提对进行训练——在事实验证等下游应用中会失败,因为输入的前提和假设可能指代不同的上下文。为突出此现象在实际应用中的影响,我们引入RefNLI,一个用于识别NLI示例中参考模糊性的诊断基准。RefNLI中,前提来自知识来源(即Wikipedia),不一定指代与假设相同的上下文。通过RefNLI,我们展示了微调后的NLI模型和少量提示的大型语言模型(LLM)都无法识别上下文不匹配,导致超过80%的矛盾预测和超过50%的蕴涵预测。我们发现,NLI示例中引用模糊性的存在在一定程度上可以解释NLI中内在的人类 disagreement,并为RD假设对NLI数据集创建过程的影响提供了见解。
引用
@article{arxiv.2502.05793,
title = {On Reference (In-)Determinacy in Natural Language Inference},
author = {Sihao Chen and Chaitanya Malaviya and Alex Fabrikant and Hagai Taitelbaum and Tal Schuster and Senaka Buthpitiya and Dan Roth},
journal= {arXiv preprint arXiv:2502.05793},
year = {2025}
}
备注
NAACL 2025 Findings