中文

面向工程仿真管道中顺序约束修复的物理信息因果 MDP

人工智能 2026-04-21 v1 机器学习

摘要

在约束 MDP 中进行离策略学习面临根本性困境:因果识别转移动力学需要结构假设,而高效的策略学习则需要状态空间压缩。我们引入 PI-CMDP 框架,其约束依赖在生命周期排序假设(LOA)下形成分层有向无环图(DAG)。我们提出 Identify-Compress-Estimate 流水线:(i)识别:LOA 使对跨层对的因果边权重实现偏摄噬识别,正式给出 LOA 被违反时的部分识别界限;(ii)压缩:马尔可夫抽象将状态基数从 2WL2^{WL} 压缩到 (W+1)L(W+1)^L,前提是满足层级优先规则和可交换性;(iii)估计:物理引导的双鲁棒估计器在物理先验优于学习模型时保持无偏并降低方差常数。我们在工程仿真管道中的约束修复问题上实例化 PI-CMDP。在 TPS 基准测试(4206 个回合)上,PI-CMDP 仅用 300 个训练回合即可实现 76.2% 的修复成功率,相较于最强基线的 70.8% 提升 5.4 个百分点,在完全数据情景下进一步缩小至 +2.8 个百分点(83.4% vs. 80.6%),同时显著降低级联失效率。所有改进在 5 个独立随机种子下均表现一致(配对 t 检验 p < 0.02)。

关键词

引用

@article{arxiv.2604.17910,
  title  = {Physics-Informed Causal MDPs for Sequential Constraint Repair in Engineering Simulation Pipelines},
  author = {Chuhan Qiao},
  journal= {arXiv preprint arXiv:2604.17910},
  year   = {2026}
}