基于金融算法方法的离线强化学习中多样化Transformer解码
人工智能
2025-02-18 v1 机器学习
摘要
离线强化学习(RL)算法使用固定的训练数据集来学习策略,然后在在线部署时与环境交互并作出决策。变压器(Transformer)作为建模时间序列数据的标准选择,在离线RL领域正日益流行。在此背景下,梯度搜索(Beam Search, BS)作为一种近似推断算法,是首选的解码方法。离线RL消除了昂贵或风险的在线数据收集的需求。然而,受限的数据集会导致不确定性,因为在执行期间,代理人可能遇到训练数据中未覆盖的陌生状态和动作序列。在此情境下,BS缺乏离线RL所必需的两个重要属性:它不考虑上述不确定性,其贪心的左右搜索方法常常导致序列变异最小,无法探索潜在的更佳替代方案。为此,我们提出了组合梯度搜索(Portfolio Beam Search, PBS),这是一种简单却有效的BS替代方案,在解码期间在Transformer模型中平衡探索与开发。我们致力于金融经济学的原理,应用于开发一种不确定性感知的多样化机制,将其集成到推断时的序列解码算法中。我们在D4RL locomotion基准测试中经验性地证明了PBS的有效性,该方法实现了更高的回报并显著降低了结果变异性。
引用
@article{arxiv.2502.10473,
title = {Diverse Transformer Decoding for Offline Reinforcement Learning Using Financial Algorithmic Approaches},
author = {Dan Elbaz and Oren Salzman},
journal= {arXiv preprint arXiv:2502.10473},
year = {2025}
}