使用强化学习微调时间序列预测器
机器学习
2026-03-23 v1 人工智能
摘要
本章节介绍了用于微调金融预测器的三个主要强化学习算法。我们提出了一个清晰的实现方案,用于将强化学习任务的损失反向传播到使用监督学习训练的模型上,并比较微调前后的性能。我们发现微调后性能提升,并将迁移学习特性引入模型中,表明微调的益处。我们还强调了调优过程及实验结果,以供实践者进行未来实现。
引用
@article{arxiv.2603.20063,
title = {Fine-tuning Timeseries Predictors Using Reinforcement Learning},
author = {Hugo Cazaux and Ralph Rudd and Hlynur Stefánsson and Sverrir Ólafsson and Eyjólfur Ingi Ásgeirsson},
journal= {arXiv preprint arXiv:2603.20063},
year = {2026}
}