完成 vs 最优性:累积损伤问题中的策略梯度
人工智能
2026-05-27 v1
摘要
累积损伤的长期决策问题将局部吸引的动作与全局不利的结果相耦合。我们识别了该类问题中策略梯度方法的两种正交失效模式,并提出一种分解方法将其分离:完成性(到达终端时段而非通过隐式终端约束退出)和最优性(在完成后匹配动态编程参考解)。在PPO带线性软惩罚下,仅授予时段访问会降低完成率:惩罚的均衡导致主导活动份额为零,而动作空间限制结合时段访问实现完成,但留下最优性差距(),我们追溯至损伤起点的第一阶段贪心承诺。我们推导出四个可测试预测,并在两个独立校准的环境中进行评估,这些环境共享相同的抽象结构,但在领域、时段、活动集合和校准数据方面存在差异:一个49步的砌砖职业生涯和一个20季的NBA前锋职业生涯。所有四个预测在定性上都得到了复制。时段不变性预测在三个中四个测试的时段上都得到满足,其中的例外符合边界(基于NBA参数)。
引用
@article{arxiv.2605.26657,
title = {Completion vs Optimality: Policy Gradient in Long-Horizon Cumulative-Damage Problems},
author = {Wolfgang Maass and Sabine Janzen},
journal= {arXiv preprint arXiv:2605.26657},
year = {2026}
}