R-ConstraintBench:评估大语言模型在 NP-完全调度问题上的表现
人工智能
2025-08-22 v1
摘要
在资源、时间和操作约束紧张的情况下进行有效调度,是资本项目、制造、物流和 IT 机群过渡等行业领域大规模规划的基础。然而,大语言模型 (LLM) 在高约束机制下推理的可靠性尚未得到充分表征。为弥补这一空白,我们提出了 R-ConstraintBench,这是一个可扩展的框架,用于在资源受限项目调度问题 (RCPSP) 上评估模型,该问题属于 NP-完全可行性类别,其难度通过约束的线性增长而增加。R-ConstraintBench 在有向无环图 (DAG) 中逐步增加非冗余优先约束,然后引入停机时间、时间窗口和析取约束。作为一个示例,我们在数据中心迁移场景中实例化该基准,并使用可行性分析和错误分析评估多个 LLM,识别出性能退化阈值以及与失败最相关的约束类型。实验表明,强模型在仅含优先约束的 DAG 上接近性能上限,但当停机时间、时间窗口和析取约束相互作用时,可行性表现急剧下降,这表明主要瓶颈是约束交互,而非图深度。在干净的合成递增任务上的表现也不能保证迁移到领域相关的场景,这凸显了泛化能力的局限性。
引用
@article{arxiv.2508.15204,
title = {R-ConstraintBench: Evaluating LLMs on NP-Complete Scheduling},
author = {Raj Jain and Marc Wetter},
journal= {arXiv preprint arXiv:2508.15204},
year = {2025}
}