中文

TreeCut:用于 LLM 幻觉评估的合成不可解数学应用题数据集

计算与语言 2025-05-21 v2 人工智能 机器学习

摘要

大型语言模型现在在标准数学应用题基准测试(例如 GSM8K)上已接近人类水平,但其真正的推理能力仍存争议。一个关键问题是,模型经常对不可解问题给出自信但毫无根据的答案。我们引入了 TreeCut,这是一个合成数据集,通过将每个问题表示为树并移除选定的必要条件,系统地生成无限的不可解数学应用题及其可解的对应问题。实验表明,TreeCut 能有效诱导大型语言模型产生幻觉,包括 GPT-4o 和 o3-mini,在零样本设置下它们各自的最坏情况场景中幻觉率分别为 64% 和 44%。进一步的分析表明,更深或更复杂的树、复合项目名称,以及移除路径中部的必要条件,都会增加幻觉的可能性,凸显了 LLM 在识别不可解数学问题方面面临的持续挑战。数据集生成代码和样本数据可在 https://github.com/j-bagel/treecut-math 获取。

关键词

引用

@article{arxiv.2502.13442,
  title  = {TreeCut: A Synthetic Unanswerable Math Word Problem Dataset for LLM Hallucination Evaluation},
  author = {Jialin Ouyang},
  journal= {arXiv preprint arXiv:2502.13442},
  year   = {2025}
}

备注

Accepted to ACL 2025 Main Conference