大型语言模型的内部一致性与自反馈:综述
计算与语言
2024-09-19 v3
摘要
大型语言模型(LLMs)常表现出推理缺陷或产生幻觉。为解决这些问题,以“Self-”为前缀的研究,如自一致性(Self-Consistency)、自改进(Self-Improve)和自精炼(Self-Refine)等,已被陆续提出。它们有一个共同点:涉及LLMs评估和更新自身。然而,这些工作缺乏统一的总结视角,现有综述主要侧重于分类。本文采用内部一致性的统一视角,为推理缺陷和幻觉提供解释。内部一致性指的是基于采样方法,LLMs的潜在层、解码层或响应层之间表达的一致性。随后,我们引入一个能够挖掘内部一致性的有效理论框架,名为自反馈(Self-Feedback)。该框架由两个模块组成:自评估(Self-Evaluation)和自更新(Self-Update)。前者捕获内部一致性信号,而后者利用这些信号来增强模型的响应或模型本身。该框架已被众多研究采用。我们按任务和工作方向系统地对这些研究进行分类;总结相关的评估方法和基准;并深入探讨“自反馈真的有效吗?”这一关切。我们还提出了几个关键观点,包括“内部一致性的沙漏演化”、“一致性(几乎)就是正确性”假设,以及“潜在推理与显式推理的悖论”。相关资源已在 https://github.com/IAAR-Shanghai/ICSFSurvey 开源。
引用
@article{arxiv.2407.14507,
title = {Internal Consistency and Self-Feedback in Large Language Models: A Survey},
author = {Xun Liang and Shichao Song and Zifan Zheng and Hanyu Wang and Qingchen Yu and Xunkai Li and Rong-Hua Li and Yi Wang and Zhonghao Wang and Feiyu Xiong and Zhiyu Li},
journal= {arXiv preprint arXiv:2407.14507},
year = {2024}
}
备注
20 pages, 10 figures, 6 tables, 13 equations