中文

ALE-Bench:用于长期目标驱动算法工程的基准测试

人工智能 2025-10-07 v2

摘要

AI 系统在诸如包递送路径规划、机组排班、工厂生产计划和电网平衡等困难优化问题域中能否发挥良好作用?我们引入 ALE-Bench——一个用于评估 AI 系统在基于得分的算法编程竞赛中表现的新基准测试。ALE-Bench 取自 AtCoder Heuristic Contests 中的真实任务,呈现计算困难且无已知精确解的优化问题。不同于短时程、通过/失败编码基准测试,ALE-Bench 鼓励在长时间范围内进行迭代式解决方案 refinement。我们的软件框架支持可交互的智能体架构,利用测试运行反馈与可视化。我们评估了前沿 LLM 的表现,发现尽管其在特定问题上表现出色,但在问题间的一致性以及长期问题解决能力方面仍存在显著差距。这凸显了该基准测试培育未来 AI 进步的必要性。

关键词

引用

@article{arxiv.2506.09050,
  title  = {ALE-Bench: A Benchmark for Long-Horizon Objective-Driven Algorithm Engineering},
  author = {Yuki Imajuku and Kohki Horie and Yoichi Iwata and Kensho Aoki and Naohiro Takahashi and Takuya Akiba},
  journal= {arXiv preprint arXiv:2506.09050},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025 Datasets & Benchmarks Track