中文

DeepSeek 与其他大语言模型的比较

计算与语言 2025-12-29 v3 人工智能

摘要

最近,DeepSeek 在 AI 社区及其外界引起了广泛关注。一个有趣的问题是,DeepSeek 如何与其他大语言模型(LLM)进行比较。LLM 可以完成许多任务,本文以“使用短文本预测结果”这一任务进行比较。我们考虑两种设置:一种是作者身份分类设置,另一种是引用类型分类设置。在第一种情况下,目标是确定一段短文本是由人类还是 AI 编写的。在第二种情况下,目标是将引用归类为四种类型之一。对于每个实验,我们将 DeepSeek 与 4 个流行的 LLM(Claude、Gemini、GPT 和 Llama)进行比较。我们发现就分类准确率而言,DeepSeek 在大多数情况下超过了 Gemini、GPT 和 Llama,但低于 Claude。我们还发现 DeepSeek 与其他模型 comparable slower(较慢),但使用成本低,而 Claude 则比所有其他模型都昂贵。最后,我们发现就相似度而言,DeepSeek 的输出最接近 Gemini 和 Claude(且在这 5 个 LLM 中,Claude 和 Gemini 的输出最为相似)。本文还提供了一个由我们自行收集的完全标注数据集,并提出了一种配方,可以使用 LLM 和近期数据集 MADStat 来生成新的数据集。本文中的数据集可用于作为面向未来 LLM 研究的基准测试。

关键词

引用

@article{arxiv.2502.03688,
  title  = {A Comparison of DeepSeek and Other LLMs},
  author = {Tianchen Gao and Jiashun Jin and Zheng Tracy Ke and Gabriel Moryoussef},
  journal= {arXiv preprint arXiv:2502.03688},
  year   = {2025}
}

备注

30 pages, 7 figures, 9 tables