ScoNe:通过微调与上下文学习评估语言模型中的否定推理能力
计算与语言
2024-04-19 v1 机器学习
摘要
近期已有若干基准旨在评估模型处理自然语言否定的能力。然而,这些基准缺乏受控的示例范式,使我们无法推断模型是否学到了否定语素在语义上的辖域。为填补这些分析空白,我们提出范围否定自然语言推理(Scoped Negation NLI,ScoNe-NLI)基准,其包含六例一组的对照集,其中至多出现两个否定,且零个、一个或两个否定语素会影响 NLI 标签。我们使用 ScoNe-NLI 评估微调与上下文学习策略。我们发现 RoBERTa 与 DeBERTa 模型在经过多样本微调后能解决 ScoNe-NLI。对于上下文学习,我们测试了 InstructGPT 模型,发现大多数提示策略均不成功,包括那些采用逐步推理的策略。为更好理解该结果,我们以 ScoNe-NLG 扩展 ScoNe,这是一个将否定推理嵌入短叙事中的句子补全测试集。在此,InstructGPT 表现成功,这表明该模型能正确进行否定推理,但在其核心预训练机制之外的提示适配 NLI 示例上难以做到这一点。
引用
@article{arxiv.2305.19426,
title = {ScoNe: Benchmarking Negation Reasoning in Language Models With Fine-Tuning and In-Context Learning},
author = {Jingyuan Selena She and Christopher Potts and Samuel R. Bowman and Atticus Geiger},
journal= {arXiv preprint arXiv:2305.19426},
year = {2024}
}