中文

基于营养酸提升的在线决策转换器微调

机器学习 2024-11-01 v1 人工智能

摘要

决策转换器最近作为一种新的且引人入目的方法在离线强化学习中发挥作用,通过自回归方式完成轨迹。尽管已有改进措施克服了初始局限,但决策转换器的在线微调仍严重未被探索。广泛采用的在线决策转换器(ODT)在使用低奖励离线数据预训练时仍面临挑战。本文对决策转换器的在线微调进行了理论分析,表明常用的返回到终点(RTG)若远离预期回报,将阻碍在线微调过程。然而,这一问题可通过标准强化学习算法的值函数和优势函数得到有效解决。根据我们的分析,在实验中我们发现,仅仅将TD3梯度添加到ODT的微调过程中即可有效提升ODT的在线微调性能,尤其是在使用低奖励离线数据预训练ODT时效果更为显著。这些发现为进一步改进决策转换器提供了新的方向。

关键词

引用

@article{arxiv.2410.24108,
  title  = {Reinforcement Learning Gradients as Vitamin for Online Finetuning Decision Transformers},
  author = {Kai Yan and Alexander G. Schwing and Yu-Xiong Wang},
  journal= {arXiv preprint arXiv:2410.24108},
  year   = {2024}
}

备注

Accepted as NeurIPS 2024 spotlight. 33 pages, 26 figures