中文

CRMArena-Pro:基于多业务场景与交互的LLM代理全面评估

机器学习 2026-02-25 v3

摘要

尽管AI代理具有变革性潜力,有效的性能基准测试却因缺乏广泛使用的公共、真实的商业数据而受限。现有基准常常在环境、数据和代理用户交互方面缺乏真实性,覆盖的业务场景和行业也有限。为填补这一空白,本文引入CRMArena-Pro,一个用于在多样化专业环境中对LLM代理进行全面、真实评估的新型基准。CRMArena-Pro在CRMArena的基础上,扩展了19个经专家验证的任务,覆盖销售、服务以及“配置、报价和报价”流程,涵盖B2B和B2C场景。其独特之处在于包含由多样化角色指导的多轮交互,以及强化保密意识的评估。实验结果表明,领先的LLM代理在CRMArena-Pro上仅实现约58%的单轮成功率,在多轮设置下性能显著下降至约35%。尽管工作流执行对顶级代理较为友好(单轮成功率超过83%),但其他评估的商业技能则提出了更大挑战。此外,代理表现出几乎零的内在保密意识;尽管有针对性的提示可以提高这一水平,但往往会牺牲任务性能。这些发现凸显了当前LLM能力与企业需求之间的巨大差距,强调在多轮推理、保密遵循和多功能技能获取方面仍需发展。

关键词

引用

@article{arxiv.2505.18877,
  title  = {RefLoRA: Refactored Low-Rank Adaptation for Efficient Fine-Tuning of Large Models},
  author = {Yilang Zhang and Bingcong Li and Georgios B. Giannakis},
  journal= {arXiv preprint arXiv:2505.18877},
  year   = {2026}
}

备注

Accepted as a conference paper at NeurIPS 2025