中文

大型语言模型的过度推理与冗余计算

计算与语言 2024-03-21 v2

摘要

大型语言模型可以逐步解决问题。虽然这种思维链推理提升了 LLM 的性能,但目前尚不清楚 LLM 是否知道何时使用 CoT,以及这些 CoT 是否总是回答问题所必需的。本文表明,LLM 倾向于在手动构建的数学问答数据集 GSM8K-Zero 上生成冗余的计算和推理。GSM8K-Zero 的构建使得问题无需任何计算即可回答,但 LLM(包括 Llama-2 模型和 Claude-2)倾向于生成冗长且不必要的计算来回答问题。我们还进行了实验以解释为什么 LLM 会生成冗余的计算和推理。GSM8K-Zero 可在 https://github.com/d223302/Over-Reasoning-of-LLMs 和 https://huggingface.co/datasets/dcml0714/GSM8K-Zero 公开获取。

关键词

引用

@article{arxiv.2401.11467,
  title  = {Over-Reasoning and Redundant Calculation of Large Language Models},
  author = {Cheng-Han Chiang and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2401.11467},
  year   = {2024}
}

备注

EACL 2024 main conference paper. Camera-ready version