中文

智能体的第一天:在工作场景中基准测试学习、探索与调度

人工智能 2026-01-14 v1

摘要

多模态大语言模型(MLLM)的快速发展推动了工作流自动化;然而,现有研究主要针对静态环境中的性能上限,忽视了随机真实世界部署的鲁棒性。我们识别出三个关键挑战:动态任务调度、不确定性下的主动探索以及从经验中持续学习。为弥合这一差距,我们引入了\method{},一个模拟“实习生”智能体持续探索新环境的动态评估环境。与传统基准不同,\method{}从三个维度评估智能体:(1) 针对具有不同优先级的流式任务的上下文感知调度;(2) 通过主动探索减少幻觉的审慎信息获取;以及(3) 通过从基于规则的、动态生成的任务中提炼通用策略来实现持续进化。实验表明,最先进的智能体在动态环境中存在显著缺陷,尤其是在主动探索和持续学习方面。我们的工作建立了一个评估智能体可靠性的框架,将评估从静态测试转向现实的、面向生产的场景。我们的代码可在 https://github.com/KnowledgeXLab/EvoEnv 获取。

关键词

引用

@article{arxiv.2601.08173,
  title  = {The Agent's First Day: Benchmarking Learning, Exploration, and Scheduling in the Workplace Scenarios},
  author = {Daocheng Fu and Jianbiao Mei and Rong Wu and Xuemeng Yang and Jia Xu and Ding Wang and Pinlong Cai and Yong Liu and Licheng Wen and Botian Shi},
  journal= {arXiv preprint arXiv:2601.08173},
  year   = {2026}
}