ACING:面向黑盒LLM指令学习的Actor-Critic方法
计算与语言
2025-09-05 v2 人工智能
机器学习
系统与控制
系统与控制
最优化与控制
摘要
大型语言模型在解决任务时的有效性在很大程度上取决于其指令的质量,而这些指令通常需要大量人力来精心设计。这凸显了自动化指令优化的需求。然而,在使用模型参数和梯度均不可访问的黑盒LLM时,优化指令尤为具有挑战性。我们引入了ACING,一个actor-critic强化学习框架,将指令优化表述为一个无状态、连续动作的问题,从而能够仅利用黑盒反馈探索无限的指令空间。ACING在76%的指令归纳任务中自动发现了优于人类编写提示的提示,在涵盖指令归纳、摘要和思维链推理的33项任务中,相比最佳自动基线获得了高达33分的提升和10分的中位数提升。广泛的消融实验突显了其鲁棒性和效率。ACING的实现可在 https://github.com/salmakh1/ACING 获取。
引用
@article{arxiv.2411.12736,
title = {ACING: Actor-Critic for Instruction Learning in Black-Box LLMs},
author = {Salma Kharrat and Fares Fourati and Marco Canini},
journal= {arXiv preprint arXiv:2411.12736},
year = {2025}
}
备注
Accepted at EMNLP 2025