LLM 评论员帮助捕捉 LLM 漏洞
软件工程
2024-07-02 v1 机器学习
摘要
强化学习从人类反馈(RLHF) fundamentally 受限于人类正确评估模型输出的能力。为提高人类评估能力并克服这一限制,本工作训练了"评论员"模型,以帮助人类更准确地评估模型编写的代码。这些评论员本身也是经过RLHF训练的LLM,用于编写自然语言评论,指出来自真实世界助手任务中代码中的问题。在包含自然发生LLM错误的代码上,模型编写的评论在63%的情况下被优于人类评论,且人类评估发现模型比为代码审查付费的人类承包商捕捉更多的漏洞。我们进一步确认,经过微调的LLM评论员能够成功识别ChatGPT训练数据中被标记为"完美无瑕"的上百个错误,尽管这些任务的大多数是非代码任务,因而对评论员模型而言属于分布外。评论员本身也可能存在局限性,包括会产生幻觉漏洞可能误导人类做出他们本可避免的错误,但人机评论员和承包商的组合捕捉的漏洞数量与LLM评论员相当,同时幻觉现象低于仅使用LLM的情况。
引用
@article{arxiv.2407.00215,
title = {LLM Critics Help Catch LLM Bugs},
author = {Nat McAleese and Rai Michael Pokorny and Juan Felipe Ceron Uribe and Evgenia Nitishinskaya and Maja Trebacz and Jan Leike},
journal= {arXiv preprint arXiv:2407.00215},
year = {2024}
}