中文

OOM-RL:基于金融市场的强化学习市场驱动的 LLM 多智能体系统对齐

人工智能 2026-04-14 v1 软件工程 交易与市场微观结构

摘要

多智能体系统(MAS)用于自主软件工程的对齐受制于评估器的认知不确定性。当前范式,如强化学习从人类反馈(RLHF)和 AI反馈(RLAIF),常导致模型盲目跟随,而基于执行的环境则受制于不受约束智能体的对抗性“测试规避”。本文引入一种客观对齐范式:"Out-of-Money Reinforcement Learning(OOM-RL)"。通过将智能体部署到非平稳、高摩擦的现实金融市场中,我们利用关键资本耗尽作为不可黑客攻击的负梯度。我们的纵向 20 个月实证研究(2024 年 7 月--2026 年 2 月)记录了系统从高周转、盲目跟随的基线向稳健、流动性感知架构的演变。我们展示,金融损失的不可否认的本体论后果迫使 MAS 放弃过拟合的幻觉,转而采用"严格测试驱动的智能体工作流程(STDAW)",该工作流程通过 Byzantine 启发的单向状态锁(RO-Lock)锚定确定性验证的 95%\geq 95\% 代码覆盖率约束矩阵。我们的结果显示,虽然早期迭代 suffer 严重的执行衰减,但最终的 OOM-RL 对齐系统在成熟阶段实现了年化 Sharpe 比率为 2.06 的稳定平衡。我们得出结论,用严格的经济惩罚取代主观的人类偏好,为对齐高风险、现实环境中的自主智能体提供了稳健的方法,为那些计算计费作为客观物理约束的通用范式奠定了基础。

关键词

引用

@article{arxiv.2604.11477,
  title  = {OOM-RL: Out-of-Money Reinforcement Learning Market-Driven Alignment for LLM-Based Multi-Agent Systems},
  author = {Kun Liu and Liqun Chen},
  journal= {arXiv preprint arXiv:2604.11477},
  year   = {2026}
}

备注

13 pages, 3 figures