偏好目标调优:将后训练视为冻结策略的潜在控制
人工智能
2026-05-04 v2 机器学习
摘要
目标条件策略使决策模型能够基于指定目标执行多样化行为,但其下游性能往往对指令或提示的选择高度敏感。为规避离散文本提示的局限性,我们将后训练适应问题形式化为潜在控制问题,其中目标嵌入作为连续控制变量用于调制冻结策略的行为。我们提出偏好目标调优(Preference Goal Tuning, PGT)框架,通过轨迹级偏好目标优化潜在控制变量,以将诱导的轨迹分布与任务偏好对齐。不同于标准微调更新策略参数,PGT 保持策略冻结,仅更新潜在目标,目标是通过轨迹级偏好目标函数实现。该方法本质上是在寻找最优条件化输入,以最大化所需行为的可能性同时抑制不良行为。我们在 Minecraft SkillForge基准测试的 17 个任务上评估了 PGT。在有限数据下,PGT 对两个基础策略实现了 72.0% 和 81.6% 的平均相对提升,始终优于专家设计的提示。关键的是,通过将任务对齐(潜在目标)与物理动态(冻结策略)解耦,PGT 在分布外设置下比完全微调高出 13.4%,显示出更好的鲁棒性和泛化能力。
引用
@article{arxiv.2412.02125,
title = {Preference Goal Tuning: Post-Training as Latent Control for Frozen Policies},
author = {Guangyu Zhao and Kewei Lian and Haoxuan Ru and Borong Zhang and Haowei Lin and Zhancun Mu and Haobo Fu and Qiang Fu and Shaofei Cai and Zihao Wang and Yitao Liang},
journal= {arXiv preprint arXiv:2412.02125},
year = {2026}
}