Prover-Verifier 游戏提高LLM输出的可检验性
计算与语言
2024-08-02 v2
摘要
增加大型语言模型(LLM)输出可信度的一种方式是通过清晰易于检查的推理过程支持其输出,我们将这种属性称为可检验性。我们在小学数学问题解决情境中研究可检验性,发现仅为答案正确性优化链式思维解答会降低其可检验性。为缓解可检验性的损失,我们提出一种受Anil等人(2021)提出的 Prover-Verifier Game 启发的训练算法。该算法迭代训练小型验证器以预测解答正确性、"有帮助的"证明者产生被验证器接受的正确解答,以及"狡诈的"证明者产生能欺骗验证器的错误解答。我们发现,有帮助的证明者的准确率和验证器对对抗性攻击的鲁棒性在训练过程中不断提高。此外,我们表明,可检验性训练可转移到由时间受限的人类任务中,用以验证解答正确性。在LLM训练过程中,人类在检查有帮助的证明者解答时准确率提高,而在检查狡诈的证明者解答时准确率下降。因此,针对小型验证器进行可检验性训练是提高大型LLM输出对人类可检验性的可行技术。我们的结果表明,针对小型验证器进行对抗训练是提高LLM输出可检验性的实用方法,可能有助于超大规模模型的对齐。
引用
@article{arxiv.2407.13692,
title = {Prover-Verifier Games improve legibility of LLM outputs},
author = {Jan Hendrik Kirchner and Yining Chen and Harri Edwards and Jan Leike and Nat McAleese and Yuri Burda},
journal= {arXiv preprint arXiv:2407.13692},
year = {2024}
}