中文

揭示竞争动态:中美大型语言模型的比较评估

计算与语言 2024-05-22 v2 人工智能

摘要

自 ChatGPT 问世以来,大型语言模型(LLMs)在经济增长、创新、社会发展和国家安全方面的战略意义日益受到重视。本研究在英文和中文语境下,对中美两国的 LLM 进行了全面的比较评估。我们提出了一个涵盖自然语言能力、学科专业知识以及安全与责任的综合评估框架,并在各种操作任务和场景下系统评估了来自美国和中国的 16 个主流模型。我们的主要发现表明,GPT-4 Turbo 在英文语境中处于领先地位,而 Ernie-Bot 4 在中文语境中脱颖而出。研究还强调了 LLM 在不同语言和任务上的性能差异,强调了在语言和文化上进行精细化模型开发的必要性。中美 LLM 的互补优势表明了中美合作在推进 LLM 技术方面的价值。该研究呈现了当前的 LLM 竞争格局,并为政策制定者和企业在 LLM 战略投资与开发方面提供了有价值的见解。未来的工作将在此框架基础上进行扩展,以纳入新兴的 LLM 多模态能力和商业应用评估。

关键词

引用

@article{arxiv.2405.06713,
  title  = {Unveiling the Competitive Dynamics: A Comparative Evaluation of American and Chinese LLMs},
  author = {Zhenhui Jiang and Jiaxin Li and Yang Liu},
  journal= {arXiv preprint arXiv:2405.06713},
  year   = {2024}
}

备注

There was a miscommunication among the co-authors, resulting in the accidental submission of this paper to arXiv. We are in need of withdrawing the paper from your platform