SPOGW:基于组关系比较的得分型偏好优化方法用于工作流程
人工智能
2025-10-07 v1
摘要
大型语言模型(LLMs)在各类领域展现出解决各种挑战性问题的显著能力,常通过遵循结构化指令和多步骤程序的代理工作流程来实现。然而,设计此类工作流程需要大量的人工工作,限制了其可扩展性和通用性。近期研究旨在减少构建其中的人工介入,推动了自动化工作流程优化技术的进展。然而,现有方法常受限于其表示能力有限、适应性不足、可扩展性弱,以及仅采用两两比较范式——这些问题主要源于对离散优化技术的依赖。为克服这些限制,我们引入一种新的基于得分的偏好方法,称为SPOGW,直接在基数奖励信号上通过组关系比较操作,实现在连续空间中更高效、更稳定的优化。SPOGW融合了迭代离线GRPO(ioGRPO)与优势掩码KL散度(mKL),后者通过更强调策略响应中有利区域的训练更新来调节。我们在覆盖数学推理、编码和问答等五个基准数据集上的实验表明,SPOGW匹配或超越了当前最先进的方法,为自动化生成和优化代理工作流程提供了一种可行且前瞻的方法。
引用
@article{arxiv.2510.04089,
title = {SPOGW: a Score-based Preference Optimization method via Group-Wise comparison for workflows},
author = {Yitong Cui and Liu Liu and Baosheng Yu and Jiayan Qiu and Xikai Zhang and Likang Xiao and Yixing Liu and Quan Chen},
journal= {arXiv preprint arXiv:2510.04089},
year = {2025}
}