MiGrATe:基于混合策略的 GRPO 测试时适应方法
机器学习
2025-08-13 v1 人工智能
计算与语言
摘要
大型语言模型 (LLM) 正在越来越多地应用于黑箱优化任务,从程序合成到分子设计。以往的工作通常利用基于情境的学习,迭代引导模型逐步趋向更好的解决方案。然而,这类方法往往难以平衡对新解空间的探索与对高回报解空间的开发。最近,利用合成数据进行测试时训练 (TTT) 在提高解质量方面显示出前景。然而,针对每个任务精心构建训练数据的需求限制了其在跨领域的可行性和可扩展性。为此,我们提出 MiGrATe——一种无需外部训练数据即可在推理时适应 LLM 的在线 TTT 方法。MiGrATe 通过一种混合策略群构造程序运行,结合基于策略的抽样与两种基于策略外的数据选择技术:贪心抽样(选择顶级过时完成)和邻域抽样 (NS)(生成结构上类似高回报完成的结果)。这些组件共同偏向策略梯度开发来自解决方案空间有前景区域的开发,同时通过基于策略的抽样保持探索。我们在三个具有挑战性的领域中评估了 MiGrATe——单词搜索、分子优化以及在抽象与推理语料库 (ARC) 上的假设+程序归纳——并发现其在推理-only 和 TTT 基线方法上 consistently 均表现更佳,展示了无需外部监督即可解决复杂搜索任务的在线 TTT 的潜力。
引用
@article{arxiv.2508.08641,
title = {MiGrATe: Mixed-Policy GRPO for Adaptation at Test-Time},
author = {Peter Phan and Dhruv Agarwal and Kavitha Srinivas and Horst Samulowitz and Pavan Kapanipathi and Andrew McCallum},
journal= {arXiv preprint arXiv:2508.08641},
year = {2025}
}