ORLoopBench:面向自我纠正与行为理性在运营研究中的求解器内循环基准
机器学习
2026-05-27 v3 人工智能
最优化与控制
摘要
运营研究实践者通过迭代过程调试不可行模型:检查不可还原子系统(IIS)、识别约束冲突、修复模型 formulation 直至恢复可行性。现有LLM基准大多将OR视为从问题描述到求解代码的单次翻译,忽略了这一诊断循环。我们将不可行模型修复formalized为求解器内循环马尔可夫决策过程,其中每个动作触发求解器重新执行和IIS重新计算,产生确定性、可验证的反馈。我们引入ORLoopBench,一个包含两个组件的基准套件:OR-Debug-Bench提供5,362个线性规划/混合整数线性规划修复实例,而OR-Bias-Bench评估库存情境下闭式操作决策理性。经求解器验证的RLVR训练使8B模型在LP修复上超越前沿API(95.3% vs 92.4% RR @5),改进诊断行为,并可迁移到MILP修复。相同评估揭示了整个模型代码再生成的语义漂移:可行再生成的MILP可能解决错误问题。具有求解器信任棱镜的过程级评估实现了针对可靠OR自我纠正的有针对性训练。
引用
@article{arxiv.2601.21008,
title = {ORLoopBench: Solver-in-the-Loop Benchmarks for Self-Correction and Behavioral Rationality in Operations Research},
author = {Ruicheng Ao and David Simchi-Levi and Xinshang Wang},
journal= {arXiv preprint arXiv:2601.21008},
year = {2026}
}
备注
58 pages, accepted by ICML 2026