中文

大语言模型在对话式问答任务中的竞争:一项比较研究

计算与语言 2024-05-29 v1 人工智能

摘要

大型语言模型因在各类任务上表现突出而受到广泛关注。在此领域中,由 OpenAI 开发的 ChatGPT 与 GPT-4,以及由 Google 开发的 Gemini,成为早期采纳者中尤为流行的模型。此外,Mistral AI 的 Mixtral 以及 Anthropic 的 Claude 也陆续发布,进一步拓展了先进语言模型的版图。这些模型被视为具有颠覆性的技术,已被应用于客户服务、教育、医疗和金融等领域。最近,Mistral 以其独特的创意内容生成能力吸引了大量用户。了解这些用户的观点至关重要,因为他们能提供宝贵的见解,帮助把握这些技术在各个领域的潜在优势、劣势以及整体成功或失败的关键。本研究深入分析了 ChatGPT、GPT-4、Gemini、Mixtral 和 Claude 在不同对话式问答语料库中生成的响应。我们仔细计算了评估分数,并进行了比较,以确定这些模型的整体表现。我们的研究指出了这些模型在提问时提供错误答案的具体案例,为揭示它们可能易于出错的区域提供了见解。总之,本研究对这些前沿语言模型进行了全面比较与评估,既阐明了其能力,也凸显了潜在的改进空间。

关键词

引用

@article{arxiv.2405.18344,
  title  = {The Battle of LLMs: A Comparative Study in Conversational QA Tasks},
  author = {Aryan Rangapur and Aman Rangapur},
  journal= {arXiv preprint arXiv:2405.18344},
  year   = {2024}
}

备注

9 pages, 4 figures, 2 tables