中文

机器更擅长复杂推理吗?揭示蕴含验证中的人机推理差距

计算与语言 2024-05-29 v3 人工智能

摘要

在文本理解中进行推理以理解含义是语言处理的核心。本文研究了多句子前提的蕴含验证(EV)问题,该问题要求系统隐式地进行多重推理。研究此类复杂前提的EV非常重要,因为现代NLP问题,例如检测不一致的模型生成理由,需要复杂的多跳推理。然而,当前的文本推理数据集大多包含短前提,仅部分关注这些挑战。为了解决这个问题,我们编制了一个EV基准,包含来自三个NLP领域(NLI、上下文问答和理由生成)的数据集,这些数据集包含多句子前提。在对人类和大语言模型(LLM)进行基准测试时,我们发现LLM在跨扩展上下文的多跳推理方面优于人类,而人类在简单的演绎推理任务中表现更好。我们还使用两个训练目标微调了一个用于EV的Flan-T5模型,获得了一个强大的开源模型,其性能优于GPT-3.5,并与GPT-4相媲美。最后,我们使用该模型在自一致性解码中过滤掉不一致的模型生成理由,使得在三个多选题数据集上的平均准确率提高了6%。

关键词

引用

@article{arxiv.2402.03686,
  title  = {Are Machines Better at Complex Reasoning? Unveiling Human-Machine Inference Gaps in Entailment Verification},
  author = {Soumya Sanyal and Tianyi Xiao and Jiacheng Liu and Wenya Wang and Xiang Ren},
  journal= {arXiv preprint arXiv:2402.03686},
  year   = {2024}
}