中文

深入审视 Gemini 的语言能力

计算与语言 2023-12-27 v2 人工智能

摘要

近期发布的 Google Gemini 系列模型是首个在广泛任务中全面报告了与 OpenAI GPT 系列相媲美结果的模型。在本文中,我们对 Gemini 的语言能力进行了深入探索,并做出了两项贡献。首先,我们提供了 OpenAI GPT 和 Google Gemini 模型能力的第三方客观比较,并附有可复现代码和完全透明的结果。其次,我们更仔细地审视了结果,找出了这两类模型中某一类表现卓越的领域。我们在 10 个数据集上进行了此项分析,测试了多种语言能力,包括推理、回答知识性问题、解决数学问题、语言间翻译、生成代码以及作为遵循指令的智能体。从该分析中,我们发现 Gemini Pro 在我们基准测试的所有任务上的准确率均接近但略逊于对应的 GPT 3.5 Turbo。我们进一步为其中一些表现不佳的情况提供了解释,包括在多位数数学推理中的失败、对多项选择答案排序的敏感性、过于严格的内容过滤等。我们还指出了 Gemini 表现出相对较高性能的领域,包括生成非英语语言以及处理更长、更复杂的推理链。复现代码和数据可在 https://github.com/neulab/gemini-benchmark 找到。

关键词

引用

@article{arxiv.2312.11444,
  title  = {An In-depth Look at Gemini's Language Abilities},
  author = {Syeda Nahida Akter and Zichun Yu and Aashiq Muhamed and Tianyue Ou and Alex Bäuerle and Ángel Alexander Cabrera and Krish Dholakia and Chenyan Xiong and Graham Neubig},
  journal= {arXiv preprint arXiv:2312.11444},
  year   = {2023}
}