通过动作梯度调整决策转换器的输出
机器学习
2025-10-08 v1 人工智能
摘要
决策转换器 (Decision Transformer, DT) 将强化学习 (RL) 与 transformer 模型集成,提出了一种新的离线 RL 方法。不同于传统算法以最大化累积折扣奖励为目标,DT 采用最大化动作概率为目标。这种范式转变带来两个关键挑战:轨迹拼接和动作外推。现有方法如用预测值替换特定 token 或集成策略梯度 (PG) 方法分别解决这些挑战,但由于内在不稳定性,无法实现稳定的组合提升。为此,我们提出动作梯度 (Action Gradient, AG),一种创新方法,直接调整动作以实现类似 PG 的功能,同时便于与 token 预测技术高效集成。AG 利用动作对 Q 值梯度进行优化。实验结果表明,我们的方法可显著提升 DT 基于算法的性能,其中一些结果已达到最先进水平。
引用
@article{arxiv.2510.05285,
title = {Adjusting the Output of Decision Transformer with Action Gradient},
author = {Rui Lin and Yiwen Zhang and Zhicheng Peng and Minghao Lyu},
journal= {arXiv preprint arXiv:2510.05285},
year = {2025}
}