更好于老师:基于特权AI反馈的LLM智能体学习
机器学习
2024-10-10 v1 人工智能
摘要
虽然大型语言模型(LLMs)在决策能力方面表现突出,但当前方法缺乏从任务执行期间的错误中进行自动自我改进的机制。我们提出了LEAP(Iterative fine-tuning with Expert teacher with privileged information),一个持续改进LLM智能体的迭代微调框架,使用来自AI专家教师的反馈。我们的关键洞察是为专家教师提供一种特权状态——在训练期间可获得但在测试期间隐藏的信息。这即使即使是弱专家也能提供精确的指导,从而显著提升学生智能体的性能,而在测试期间不访问特权信息。我们在包括文本游戏(ALFWorld)、网页导航(WebShop)和交互式编码(Intercode Bash)在内的多样化决策基准上评估了LEAP。我们的实验表明,LEAP(1)在行为模仿和ReAct基线之外取得优异成绩;(2)使弱学生模型(如Llama3-8B)的性能超过强教师模型(GPT4-o);(3)允许弱模型使用自身的特权版本进行自我改进。我们还提供了理论分析,表明LEAP的成功取决于在特权信息与学生可实现性之间进行平衡,这一理论结果我们通过实验验证。我们的代码已公开于 https://leap-llm.github.io。
引用
@article{arxiv.2410.05434,
title = {Better than Your Teacher: LLM Agents that learn from Privileged AI Feedback},
author = {Sanjiban Choudhury and Paloma Sodhi},
journal= {arXiv preprint arXiv:2410.05434},
year = {2024}
}
备注
34 pages, 6 figures, 5 tables