基于专家因素的学习:用于公式化 Alpha 挖掘的轨迹级奖励塑形
机器学习
2025-07-29 v1 人工智能
投资组合管理
摘要
强化学习(RL)已成功自动化了挖掘公式化 Alpha 因子、创建可解释且有利可图的投资策略的复杂过程。然而,现有方法因底层马尔可夫决策过程中稀疏奖励而受限。这一不效率限制了对庞大符号搜索空间的探索,并不稳定训练过程。为此,提出了轨迹级奖励塑形(TLRS),这是一种新型奖励塑形方法。TLRS 通过测量部分生成表达式与一组专家设计公式之间的次序列级相似性,提供稠密的中间奖励。此外,引入了奖励居中机制以减少训练方差。对六个主要中国和美国股票指数进行大量实验表明,TLRS 通过显著提高挖掘因子的预测能力,将 Rank Information Coefficient 提升了 9.29%,显著优于现有的基于潜在的塑形算法。值得注意的是,TLRS 通过将特征维度相对于距离基线的方法的时间复杂性从线性降低到常数,实现了在计算效率上的重大突破。
引用
@article{arxiv.2507.20263,
title = {Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining},
author = {Junjie Zhao and Chengxi Zhang and Chenkai Wang and Peng Yang},
journal= {arXiv preprint arXiv:2507.20263},
year = {2025}
}