规划中基准比较的批判性评估
人工智能
2011-06-10 v1
摘要
规划研究的最新趋势使得经验比较变得普遍。该领域已开始形成一种用于此类比较的方法论,出于明显的实际原因,该方法论需要在问题子集上运行规划器子集。在本文中,我们描述了该方法论,并检验了在许多此类比较中关于问题、规划器和指标的八个隐含假设。问题假设是:PR1) 通用规划器的性能不应因在问题和领域样本上执行而受到惩罚/偏差,PR2) 表示中的微小句法差异不影响性能,PR3) 问题应可由STRIPS能力的规划器解决,除非它们需要ADL。规划器假设是:PL1) 最新版本的规划器是最佳选择,PL2) 默认参数设置近似于良好性能,PL3) 时间截止不会不当偏倚结果。指标假设是:M1) 当在降级的运行时环境(例如,机器平台)上运行时,每个规划器的性能以类似方式下降,M2) 规划步骤的数量区分性能。我们发现这些假设大多未得到经验支持;特别是,规划器受这些假设的影响不同。我们最后呼吁社区投入研究资源以改进实践现状,特别是增强可用的基准问题。
引用
@article{arxiv.1106.1804,
title = {A Critical Assessment of Benchmark Comparison in Planning},
author = {E. Dahlman and A. E. Howe},
journal= {arXiv preprint arXiv:1106.1804},
year = {2011}
}