大型语言模型在 VNHSGE 英语数据集上的性能比较:OpenAI ChatGPT、Microsoft Bing Chat 与 Google Bard
计算与语言
2023-07-21 v3 人机交互
摘要
本文展示了三种大型语言模型(LLM),即 OpenAI ChatGPT、Microsoft Bing Chat(BingChat)和 Google Bard,在 VNHSGE 英语数据集上的性能比较。BingChat、Bard 和 ChatGPT(GPT-3.5)的性能分别为 92.4%、86% 和 79.2%。结果表明 BingChat 优于 ChatGPT 和 Bard。因此,在 ChatGPT 尚未在越南正式可用的情况下,BingChat 和 Bard 可替代 ChatGPT。结果还表明,BingChat、Bard 和 ChatGPT 的英语能力优于越南学生。本研究的发现有助于理解 LLM 在英语教育中的潜力。ChatGPT、BingChat 和 Bard 的卓越表现展示了它们作为高中英语教学与学习有效工具的潜力。
引用
@article{arxiv.2307.02288,
title = {Performance Comparison of Large Language Models on VNHSGE English Dataset: OpenAI ChatGPT, Microsoft Bing Chat, and Google Bard},
author = {Xuan-Quy Dao},
journal= {arXiv preprint arXiv:2307.02288},
year = {2023}
}
备注
11 pages, 8 figures