多色目标用于强化学习
机器学习
2026-05-05 v6 人工智能
摘要
强化学习微调(RLFT)是改进预训练策略以适应下游任务的主导范式。这些预训练策略是在大规模数据集上训练的,产生具有广泛潜在但未精炼行为的生成结果。然而,RLFT 的一个关键失效模式是当策略失去这种多样性并坍缩为少数易被利用的输出时。这种收敛会阻碍探索,而探索对于扩大预训练策略能力至关重要,也对于放大测试时计算规模的收益至关重要。为此,我们引入了一个用于策略梯度方法的目标,以显式强制对多样生成的探索与精炼,我们称之为多色目标。我们随后展示了如何将近端策略优化(PPO)适应以优化该目标。我们的方法(1)采用藤状抽样收集在策略上的滚动结果,(2)修改优势函数以反映我们的新目标下的优势。在 BabyAI、Minigrid 和算法创意实验中,我们的方法通过可靠地解决更大范围的环境配置并在大规模扰动下实现更好的泛化,提高了成功率。此外,在给定多个尝试的 pass@ 实验中,该策略实现了显著的更高覆盖率,展示了其在保持和利用多样化策略库方面的能力。
引用
@article{arxiv.2509.25424,
title = {Polychromic Objectives for Reinforcement Learning},
author = {Jubayer Ibn Hamid and Ifdita Hasan Orney and Ellen Xu and Chelsea Finn and Dorsa Sadigh},
journal= {arXiv preprint arXiv:2509.25424},
year = {2026}
}