ALE-Bench:用于长期目标驱动算法工程的基准测试
人工智能
2025-10-07 v2
摘要
AI 系统在诸如包递送路径规划、机组排班、工厂生产计划和电网平衡等困难优化问题域中能否发挥良好作用?我们引入 ALE-Bench——一个用于评估 AI 系统在基于得分的算法编程竞赛中表现的新基准测试。ALE-Bench 取自 AtCoder Heuristic Contests 中的真实任务,呈现计算困难且无已知精确解的优化问题。不同于短时程、通过/失败编码基准测试,ALE-Bench 鼓励在长时间范围内进行迭代式解决方案 refinement。我们的软件框架支持可交互的智能体架构,利用测试运行反馈与可视化。我们评估了前沿 LLM 的表现,发现尽管其在特定问题上表现出色,但在问题间的一致性以及长期问题解决能力方面仍存在显著差距。这凸显了该基准测试培育未来 AI 进步的必要性。
引用
@article{arxiv.2506.09050,
title = {ALE-Bench: A Benchmark for Long-Horizon Objective-Driven Algorithm Engineering},
author = {Yuki Imajuku and Kohki Horie and Yoichi Iwata and Kensho Aoki and Naohiro Takahashi and Takuya Akiba},
journal= {arXiv preprint arXiv:2506.09050},
year = {2025}
}
备注
Accepted at NeurIPS 2025 Datasets & Benchmarks Track