中文

LLM 精炼的艺术:询问、精炼与信任

计算与语言 2023-11-15 v1

摘要

近年来,大型语言模型(LLMs)展现出卓越的生成能力,但它们能否评判自身生成内容的质量?一个被称为自精炼(self-refinement)的流行概念假设,LLMs 在被告知时可检测并纠正其生成中的错误。然而,近期的经验证据指向相反方向,表明 LLMs 在涉及推理时往往难以准确识别错误。为此,我们提出一种带精炼目标的推理方法 ART:Ask、Refine、Trust(询问、精炼与信任),其通过提出必要问题来决定 LLM 何时应当精炼其输出,并通过为精炼结果与初始预测排序来确认或保留对其精炼的信任。在两个多步推理任务——数学应用题(GSM8K)与问答(StrategyQA)——上,ART 相较自精炼基线取得 +5 分的性能提升,同时使用小得多的模型作为决策器。我们还展示了使用较小模型做出精炼决策的优势,将其作为微调较大模型的一种高性价比替代方案。

关键词

引用

@article{arxiv.2311.07961,
  title  = {The ART of LLM Refinement: Ask, Refine, and Trust},
  author = {Kumar Shridhar and Koustuv Sinha and Andrew Cohen and Tianlu Wang and Ping Yu and Ram Pasunuru and Mrinmaya Sachan and Jason Weston and Asli Celikyilmaz},
  journal= {arXiv preprint arXiv:2311.07961},
  year   = {2023}
}