中文

ChatGPT 能捍卫其对真理的信念吗?通过辩论评估 LLM 推理

计算与语言 2023-10-11 v2

摘要

诸如 ChatGPT 和 GPT-4 之类的大语言模型(LLMs)在复杂推理任务中展现出令人印象深刻的性能。然而,很难知晓这些模型是基于对真理和逻辑的深层理解进行推理,还是以相对肤浅的方式利用其记忆的模式。在这项工作中,我们探索通过让 LLM 参与类辩论的对话来测试其推理:给定一个问题时,LLM 与用户需要从对立论点出发进行讨论以做出正确决策。在缓解 Clever Hans 效应后,我们的任务要求 LLM 不仅自身得出正确答案,还要能够坚持并捍卫其信念,而非盲目相信或被用户(无效)论点和批评所误导,从而更深入地测试 LLM 是否掌握了解决问题所需推理的本质。在涵盖数学、常识、逻辑和 BIG-Bench 任务的一系列复杂推理基准上,我们发现尽管现有工作报道其在初始生成正确逐步解答方面性能令人印象深刻,像 ChatGPT 这样的 LLM 在受到常常是荒谬无效论点的挑战时,无法在相当大比例的例子中维持其对真理的信念。我们的工作指出了模型对齐的危险区,也建议对近期关于 LLM 可基于反馈改进其回复的发现进行更审慎的处理和解读。

关键词

引用

@article{arxiv.2305.13160,
  title  = {Can ChatGPT Defend its Belief in Truth? Evaluating LLM Reasoning via Debate},
  author = {Boshi Wang and Xiang Yue and Huan Sun},
  journal= {arXiv preprint arXiv:2305.13160},
  year   = {2023}
}

备注

EMNLP-23 (findings)