中文

LLM 多步推理中自一致性的两种失效

计算与语言 2024-02-09 v4

摘要

大语言模型(LLMs)已在多种上下文少样本任务上取得广泛成功,但这种成功通常经由正确性而非一致性来评估。我们认为,在解由多个子步骤答案组合而成的任务中,自一致性是有效多步推理的重要准则。我们提出对多步推理尤为重要的两类自一致性——假设一致性(模型预测其在另一假设上下文中会输出什么的能力)与组合一致性(当中间子步骤被模型对这些步骤的输出替换时,模型最终输出的一致性)。我们证明 GPT-3/-4 模型的多个变体在多种任务上的两类一致性均表现出较差的一致率。

关键词

引用

@article{arxiv.2305.14279,
  title  = {Two Failures of Self-Consistency in the Multi-Step Reasoning of LLMs},
  author = {Angelica Chen and Jason Phang and Alicia Parrish and Vishakh Padmakumar and Chen Zhao and Samuel R. Bowman and Kyunghyun Cho},
  journal= {arXiv preprint arXiv:2305.14279},
  year   = {2024}
}

备注

Accepted to TMLR: https://openreview.net/forum?id=5nBqY1y96B