从 AI 助手到 AI 科学家:基于 LLM 代理的 LLM-RL 算法自主发现
计算与语言
2026-03-26 v1
摘要
发现面向语言模型的改进策略优化算法的过程一直昂贵且依赖反复的机制级修改和验证。与简单的组合代码搜索不同,这一问题需要在与训练动力学紧密耦合的算法机制上进行搜索,同时在迭代之间复用经验证据。我们提出了 POISE(Policy Optimization via Iterative Search and Evaluation),一个用于自动发现语言模型策略优化算法的闭环框架。POISE 维护一个结构化的、基因关联的档案库,将提案、可执行实现、标准化评估和自然语言反思链接起来,以支持证据驱动的迭代。在从 GRPO 开始的数学推理实验中,POISE 评估了 64 个候选算法并发现了改进机制,包括解析方差缩放和有效性掩码。最佳变体将加权 Overall 从 47.8 提升至 52.5(提升 4.6),AIME25 pass@32 从 26.7% 提升至 43.3%,证明了在支持可解释设计原则的同时实现自动策略优化发现的可行性。
引用
@article{arxiv.2603.23951,
title = {From AI Assistant to AI Scientist: Autonomous Discovery of LLM-RL Algorithms with LLM Agents},
author = {Sirui Xia and Yikai Zhang and Aili Chen and Siye Wu and Siyu Yuan and Yanghua Xiao},
journal= {arXiv preprint arXiv:2603.23951},
year = {2026}
}