采用 LoRA 适配的预训练大语言模型作为量化交易中离线强化学习的决策变换器
计算金融
2024-11-28 v1
摘要
开发有效的量化交易策略使用强化学习(RL)具有高风险,因为需要与实时金融市场进行在线交互。因此,离线 RL 依赖历史市场数据而无需额外探索,变得至关重要。然而,现有的离线 RL 方法往往难以捕捉金融时间序列中复杂的时序依赖关系,可能过度拟合历史模式。为此,我们引入一个使用低秩适应(LoRA)微调的预训练 GPT-2 权重初始化的决策变换器(Decision Transformer)。该架构利用预训练语言模型的泛化能力和 LoRA 的效率,从历史数据中仅从专家轨迹学习有效的交易策略。我们的模型在包括保守 Q 学习(CQL)、隐式 Q 学习(IQL)和行为克隆(BC)等既有离线 RL 算法,以及使用随机初始化 GPT-2 权重和 LoRA 的基准决策变换器方面,表现出竞争力。实证结果表明,我们的方法有效地从专家轨迹中学习,部分交易情境中实现更高的奖励,凸显了将预训练语言模型和参数高效微调集成到量化交易中离线 RL 的有效性。我们实验的复制代码已公开available at https://github.com/syyunn/finrl-dt。
引用
@article{arxiv.2411.17900,
title = {Pretrained LLM Adapted with LoRA as a Decision Transformer for Offline RL in Quantitative Trading},
author = {Suyeol Yun},
journal= {arXiv preprint arXiv:2411.17900},
year = {2024}
}
备注
Accepted for presentation at the ICAIF 2024 Workshop on LLMs and Generative AI for Finance (poster session)