中文

使用强化学习微调时间序列预测器

机器学习 2026-03-23 v1 人工智能

摘要

本章节介绍了用于微调金融预测器的三个主要强化学习算法。我们提出了一个清晰的实现方案,用于将强化学习任务的损失反向传播到使用监督学习训练的模型上,并比较微调前后的性能。我们发现微调后性能提升,并将迁移学习特性引入模型中,表明微调的益处。我们还强调了调优过程及实验结果,以供实践者进行未来实现。

关键词

引用

@article{arxiv.2603.20063,
  title  = {Fine-tuning Timeseries Predictors Using Reinforcement Learning},
  author = {Hugo Cazaux and Ralph Rudd and Hlynur Stefánsson and Sverrir Ólafsson and Eyjólfur Ingi Ásgeirsson},
  journal= {arXiv preprint arXiv:2603.20063},
  year   = {2026}
}