自然语言推理中的错误为何常由改写变异性导致?
计算与语言
2024-04-19 v1
摘要
大型语言模型在应对意义保存的改写输入时表现出不一致性。与此同时,研究人员评估这些模型的知识和推理能力时,未对改写变异性对性能的影响进行细分。我们提出了一种用于评估自然语言推理模型改写一致性的指标,基于模型在两个改写版本的同一问题上获得相同正确性概率。我们在数学上将该指标与模型正确性方差中可归因于改写比例相联系。为估计改写一致性,我们收集了ParaNLU数据集,包含7,782个由人类撰写并验证的改写推理问题,这些问题构建于用于可妥协性和归纳性自然语言推理的现有基准数据集之上。使用ParaNLU,我们测量了几类模型的改写一致性,表明预训练显著提升了一致性,但微调并未实现此提升。所有测试的模型在改写一致性方面都有提升空间。
关键词
引用
@article{arxiv.2404.11717,
title = {How often are errors in natural language reasoning due to paraphrastic variability?},
author = {Neha Srikanth and Marine Carpuat and Rachel Rudinger},
journal= {arXiv preprint arXiv:2404.11717},
year = {2024}
}
备注
accepted to TACL 2024 (pre-MIT Press publication version)