中文

犯错并不容易:大语言模型在排除法推理上表现不佳

计算与语言 2024-06-11 v3

摘要

思维链(COT)提示可帮助大语言模型(LLMs)推理出正确答案,但其在推理出错误答案方面的有效性尚待探索。这种排除法(PoE)在与 COT 结合使用时,可增强自一致性、可解释性以及诸如排除性医学诊断等任务。因此,我们提出结合 COT 的 PoE,要求 LLMs 在多项选择题上推理出错误选项。我们评估了 GPT-3.5、LLaMA-2 和 Falcon 在总计四个常识与科学推理数据集上执行结合 COT 的 PoE 的能力。我们发现,PoE 策略始终逊于选择正确答案的策略。这些策略之间的一致性也低于各策略自身的自一致性。为了进一步研究这些问题,我们进行了错误分析并给出了未来工作的建议。

关键词

引用

@article{arxiv.2311.07532,
  title  = {It's Not Easy Being Wrong: Large Language Models Struggle with Process of Elimination Reasoning},
  author = {Nishant Balepur and Shramay Palta and Rachel Rudinger},
  journal= {arXiv preprint arXiv:2311.07532},
  year   = {2024}
}

备注

ACL 2024 (Findings)