中文

当有效信号失败:LLM 特征与RL交易策略之间的计量 regime 边界

种群与进化 2026-04-14 v1

摘要

大型语言模型(LLM)能否生成能够改进强化学习(RL)交易智能体的连续数值特征?我们构建了一个模块化管道,其中冻结的LLM作为无状态特征提取器,将非结构化的每日新闻和文件转化为下游PPO智能体消耗的固定维度向量。我们引入了一个自动化的提示优化循环,将提取提示视为离散超参数,直接针对信息系数(Information Coefficient,即预测值与实现值之间的斯佩尔曼秩相关)进行调优,而非传统的NLP损失。优化后的提示发现了真正具有预测性的特征(在 held-out 数据上的IC超过0.15)。然而,这些有效的中间表示并不自动转化为下游任务的性能:在由宏观经济冲击引起的分布迁移期间,LLM派生的特征引入了噪声,导致增强型智能体的表现不如仅基于价格的基线差。而在较为平静的测试 regime 中,智能体能够恢复正常,但宏观经济状态变量仍是政策改进的最可靠驱动因素。我们的发现凸显了特征层面有效性与政策层面鲁棒性之间的鸿沟,这与迁移学习在分布迁移下的已知挑战相呼应。

关键词

引用

@article{arxiv.2604.10995,
  title  = {How complex behavioural contagion can prevent infectious diseases from becoming endemic},
  author = {Michael J. Plank and Matt Ryan and Lloyd Chapman and Roslyn I. Hickson and Thomas House and Emma McBryde and James M. McCaw},
  journal= {arXiv preprint arXiv:2604.10995},
  year   = {2026}
}