LLM 多步推理中自一致性的两种失效
计算与语言
2024-02-09 v4
摘要
大语言模型(LLMs)已在多种上下文少样本任务上取得广泛成功,但这种成功通常经由正确性而非一致性来评估。我们认为,在解由多个子步骤答案组合而成的任务中,自一致性是有效多步推理的重要准则。我们提出对多步推理尤为重要的两类自一致性——假设一致性(模型预测其在另一假设上下文中会输出什么的能力)与组合一致性(当中间子步骤被模型对这些步骤的输出替换时,模型最终输出的一致性)。我们证明 GPT-3/-4 模型的多个变体在多种任务上的两类一致性均表现出较差的一致率。
引用
@article{arxiv.2305.14279,
title = {Two Failures of Self-Consistency in the Multi-Step Reasoning of LLMs},
author = {Angelica Chen and Jason Phang and Alicia Parrish and Vishakh Padmakumar and Chen Zhao and Samuel R. Bowman and Kyunghyun Cho},
journal= {arXiv preprint arXiv:2305.14279},
year = {2024}
}
备注
Accepted to TMLR: https://openreview.net/forum?id=5nBqY1y96B