中文

欲速则不达:评估 LLM 在动作间存在时间约束的高效可行多任务中的规划能力

计算与语言 2025-03-05 v1

摘要

尽管基于大型语言模型的智能体在任务完成方面取得了实质性进展,但现有的评估基准往往过度强调单任务性能,而对现实场景中所需的多任务规划和执行效率等关键方面关注不足。为了弥补这一差距,我们提出了 Recipe2Plan,一个基于真实烹饪场景的新型基准框架。与传统基准不同,Recipe2Plan 要求智能体通过并行执行任务来优化烹饪时间,同时遵守时间约束,即特定动作需要在前序步骤之后的特定时间间隔内执行。过于激进的局部并行化可能会破坏这一约束,从而可能危及整个烹饪过程。动作之间的这种严格时间约束给智能体带来了独特的挑战,要求其在最大化并发操作和遵守关键时间约束之间取得平衡。对 SOTA 模型进行的广泛实验揭示了在保持效率与可行性之间平衡方面的挑战。结果强调,大型语言模型需要改进时间感知和全局多任务处理能力。我们在 https://github.com/WilliamZR/Recipe2Plan 开源了我们的基准和代码。

关键词

引用

@article{arxiv.2503.02238,
  title  = {Haste Makes Waste: Evaluating Planning Abilities of LLMs for Efficient and Feasible Multitasking with Time Constraints Between Actions},
  author = {Zirui Wu and Xiao Liu and Jiayi Li and Lingpeng Kong and Yansong Feng},
  journal= {arXiv preprint arXiv:2503.02238},
  year   = {2025}
}