中文

基于大语言模型判断器的智能体股票预测系统的多维行为评估:基于闭环强化学习反馈

机器学习 2026-05-19 v3 人工智能 计算与语言 计算金融

摘要

智能体人工智能系统通过一系列相互依赖的自主决策产生输出,然而标准评估仅评估输出本身,无法诊断底层过程。我们发展了一种行为评估方法,补充输出层测试,通过对中间决策过程进行评分。在每个自主决策点记录的行为轨迹被分组为五天的剧集,并通过三个大语言模型(LLM)判断器在六个领域特定维度上进行评分(区间检测、路由、适应性、风险校准、策略一致性、错误恢复)。一种扰动程序在保持其他五个维度完整的同时损坏一个维度,确认了维度的特定性;跨模型间的一致性达到Krippendorff的alpha = 0.85。组合行为得分与实现的20天夏普比率在Spearman rho = 0.72处呈相关。闭环地,该框架将各维度得分不足的地方转化为分配给奖励的惩罚项添加到Soft Actor-Critic奖励中。三次精调(仅限于验证数据)将一天的MAPE从0.61%降至0.54%(相对降幅11.5%,p<0.001,d=0.31),在保留的2017至2025测试期间具有显著性,经Diebold-Mariano检验和Giacomini-White局部化。该方法具有广泛适用性,可应用于任何可记录中间决策的智能体系统。

关键词

引用

@article{arxiv.2605.05739,
  title  = {Multi-Dimensional Behavioral Evaluation of Agentic Stock Prediction Systems Using Large Language Model Judges with Closed-Loop Reinforcement Learning Feedback},
  author = {Mohammad Al Ridhawi and Mahtab Haj Ali and Hussein Al Osman},
  journal= {arXiv preprint arXiv:2605.05739},
  year   = {2026}
}

备注

17 pages, 5 figures, 14 tables. Manuscript submitted to Applied Artificial Intelligence (Taylor and Francis)