中文

大型语言模型在 VNHSGE 英语数据集上的性能比较:OpenAI ChatGPT、Microsoft Bing Chat 与 Google Bard

计算与语言 2023-07-21 v3 人机交互

摘要

本文展示了三种大型语言模型(LLM),即 OpenAI ChatGPT、Microsoft Bing Chat(BingChat)和 Google Bard,在 VNHSGE 英语数据集上的性能比较。BingChat、Bard 和 ChatGPT(GPT-3.5)的性能分别为 92.4%、86% 和 79.2%。结果表明 BingChat 优于 ChatGPT 和 Bard。因此,在 ChatGPT 尚未在越南正式可用的情况下,BingChat 和 Bard 可替代 ChatGPT。结果还表明,BingChat、Bard 和 ChatGPT 的英语能力优于越南学生。本研究的发现有助于理解 LLM 在英语教育中的潜力。ChatGPT、BingChat 和 Bard 的卓越表现展示了它们作为高中英语教学与学习有效工具的潜力。

关键词

引用

@article{arxiv.2307.02288,
  title  = {Performance Comparison of Large Language Models on VNHSGE English Dataset: OpenAI ChatGPT, Microsoft Bing Chat, and Google Bard},
  author = {Xuan-Quy Dao},
  journal= {arXiv preprint arXiv:2307.02288},
  year   = {2023}
}

备注

11 pages, 8 figures