中文

评估人类水平 LLM 的性能——LLM 正在取代您的工作吗?

计算机与社会 2024-10-23 v1 人工智能 计算与语言

摘要

本文提出并验证了 SelfScore,这是一个用于评估自动化大型语言模型 (LLM) 代理在帮助台和专业咨询任务中的性能的新基准。鉴于 AI 在各行各业中的日益集成,特别是在客户服务领域,SelfScore 填补了一个关键空白,使能够比较自动化代理和人类工作人员。该基准评估代理在问题复杂性和响应有帮助性方面的表现,确保其评分系统的透明性和简单性。该研究还开发了自动化 LLM 代理来评估 SelfScore,并探讨了检索增强生成 (RAG) 对特定领域任务的优势,表明包含 RAG 的自动化 LLM 代理在表现上优于不包含 RAG 的代理。所有自动化 LLM 代理的观察表现优于人类对照组。鉴于这些结果,本研究提出了关于 AI 技术在其擅长领域区域中可能取代人类工作人员的潜在担忧。最终,SelfScore 提供了一个理解 AI 在帮助台环境中的影响的基础工具,同时致力于在向自动化过渡过程中考虑伦理问题。

关键词

引用

@article{arxiv.2410.16285,
  title  = {Assessing the Performance of Human-Capable LLMs -- Are LLMs Coming for Your Job?},
  author = {John Mavi and Nathan Summers and Sergio Coronado},
  journal= {arXiv preprint arXiv:2410.16285},
  year   = {2024}
}