中文

中国工业场景下大语言模型准确性与鲁棒性的实证研究

计算与语言 2024-02-06 v1 人工智能

摘要

近年来,大语言模型(LLM)在各个领域迅速发展。为了更好地服务庞大的中国用户群体,许多中国商业供应商采取了本地化策略,训练并提供专门为中国用户定制的本地 LLM。此外,展望未来,LLM 的关键未来应用之一将是企业和用户在相关领域的工业生产中的实际部署。然而,工业场景中 LLM 的准确性和鲁棒性尚未得到充分研究。本文对中国工业生产背景下的 LLM 准确性和鲁棒性进行了全面的实证研究。我们手动收集了来自 8 个不同工业部门的 1,200 个领域特定问题以评估 LLM 的准确性。此外,我们设计了一个包含四个工业特定稳定性类别和八种能力的元测试框架,共计 13,631 个带有变体的问题,以评估 LLM 的鲁棒性。总体而言,我们评估了由中国供应商开发的 9 种不同 LLM,以及由全球供应商开发的 4 种不同 LLM。我们的主要发现包括:(1) 当前 LLM 在中国工业环境中的准确性较低,所有 LLM 的得分均低于 0.6。(2) 鲁棒性得分因工业部门而异,本地 LLM 的整体表现不如全球 LLM。(3) LLM 的鲁棒性在不同能力间存在显著差异。全球 LLM 在与逻辑相关的变体下更具鲁棒性,而先进的本地 LLM 在涉及理解中国工业术语的问题上表现更好。我们的研究结果为从开发和工业企业角度理解和提升 LLM 的工业领域能力提供了有价值的指导。结果进一步激发了可能的研究方向和工具支持。

关键词

引用

@article{arxiv.2402.01723,
  title  = {An Empirical Study on Large Language Models in Accuracy and Robustness under Chinese Industrial Scenarios},
  author = {Zongjie Li and Wenying Qiu and Pingchuan Ma and Yichen Li and You Li and Sijia He and Baozheng Jiang and Shuai Wang and Weixi Gu},
  journal= {arXiv preprint arXiv:2402.01723},
  year   = {2024}
}