中文

基于不可解数学应用题的大语言模型幻觉基准测试

计算与语言 2024-03-07 v1

摘要

大语言模型(LLM)在各种自然语言处理(NLP)任务中表现高效。然而,它们容易在模糊语境中产生不可靠的推测,即所谓幻觉。本文提出了一种基于不可解数学应用题(MWP)评估问答(QA)任务中 LLM 幻觉的新方法。为支持该方法,我们创新性地构建了一个名为“不可解数学应用题”(UMWP)的数据集,包含五个类别的 5200 个问题。我们开发了一种结合文本相似度和数学表达式检测的评估方法,以判断 LLM 是否认为问题不可解。对包括 GPT-3、InstructGPT、LLaMA 和 Claude 在内的 31 个 LLM 进行的大量实验结果表明,上下文学习(in-context learning)和基于人类反馈的强化学习(RLHF)训练显著增强了模型避免幻觉的能力。我们证明了利用 MWP 是评估幻觉的一种可靠且有效的方法。我们的代码和数据可在 https://github.com/Yuki-Asuuna/UMWP 获取。

关键词

引用

@article{arxiv.2403.03558,
  title  = {Benchmarking Hallucination in Large Language Models based on Unanswerable Math Word Problem},
  author = {Yuhong Sun and Zhangyue Yin and Qipeng Guo and Jiawen Wu and Xipeng Qiu and Hui Zhao},
  journal= {arXiv preprint arXiv:2403.03558},
  year   = {2024}
}

备注

11 pages, 8 figures, accepted by LREC-Coling 2024