莫伊拉:基于语言驱动的层次化强化学习用于配对交易
人工智能
2026-05-05 v1 计算与语言
多智能体系统
摘要
许多序列决策问题具有层次结构,其中高层次语义选择约束下游动作,且反馈延迟且模糊不清。在此类设置下学习面临信用分配挑战:由于抽象不良、次优执行或其相互作用,可能导致性能下降。我们通过配对交易问题来研究这一挑战,该问题自然地将长期资产对选择的语义推理与部分可观测性下的短期执行相结合。我们将配对交易建模为层次化强化学习问题,提出一种语言驱动的优化框架,其中高层次和低层次策略均由大语言模型(LLM)参数化,并通过提示更新进行优化。该方法利用预训练LLM作为层次化策略,利用轨迹和剧集级别的文本反馈来适应抽象和执行,而无需基于梯度的微调。通过显式将抽象选择与执行分离,该框架减少了层次化水平之间的非平稳性,并在延迟反馈下实现针对性适应。实验在真实市场数据上表明,与传统和基于LLM的基线方法相比,语言驱动的层次化强化学习持续取得改进,展示了其有效性。
引用
@article{arxiv.2605.01954,
title = {Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading},
author = {Polydoros Giannouris and Yuechen Jiang and Lingfei Qian and Yuyan Wang and Xueqing Peng and Jimin Huang and Guojun Xiong and Sophia Ananiadou},
journal= {arXiv preprint arXiv:2605.01954},
year = {2026}
}