轨迹对齐系数的两幕剧:从奖励调优到奖励学习
机器学习
2026-01-26 v1 人机交互
摘要
强化学习的成功从根本上依赖于拥有一个能准确反映任务目标的奖励函数。然而,设计奖励函数是出了名的耗时且容易出错。为解决这个问题,我们的第一个目标是理解如何支持强化学习实践者为奖励函数指定合适的权重。我们利用轨迹对齐系数(TAC),一个评估奖励函数诱导的偏好与领域专家偏好匹配程度的指标。为了评估TAC在实践中是否提供有效支持,我们进行了一项人类受试者研究,其中强化学习实践者为Lunar Lander调优奖励权重。我们发现,与没有TAC的标准调优相比,在奖励调优期间提供TAC使参与者产生了性能更好的奖励函数,并报告了更低的认知负荷。然而,该研究也强调,即使有TAC,手动奖励设计仍然劳动密集。这一局限性促使了我们的第二个目标:学习一个直接最大化TAC的奖励模型。具体来说,我们提出了Soft-TAC,一个TAC的可微近似,可以作为损失函数从人类偏好数据中训练奖励模型。在赛车模拟器Gran Turismo 7中验证,使用Soft-TAC训练的奖励模型成功捕获了偏好特定的目标,产生了比使用标准交叉熵损失训练的模型在行为上具有更明显差异的策略。这项工作表明,TAC既可以作为指导奖励调优的实用工具,也可以作为复杂领域中的奖励学习目标。
引用
@article{arxiv.2601.16906,
title = {The Trajectory Alignment Coefficient in Two Acts: From Reward Tuning to Reward Learning},
author = {Calarina Muslimani and Yunshu Du and Kenta Kawamoto and Kaushik Subramanian and Peter Stone and Peter Wurman},
journal= {arXiv preprint arXiv:2601.16906},
year = {2026}
}