中文

小型语言模型是否已准备好与大型语言模型在实际应用中竞争?

计算与语言 2025-03-13 v3 人工智能 机器学习

摘要

语言模型的迅速崛起扩展了它们在多个应用中的使用。然而,由于模型规模的限制、相关成本或专有约束,使用最先进的大型语言模型并不总是可行的。随着开源的小型语言模型的出现,更多应用可以利用它们的能力,但选择正确的语言模型可能具有挑战性,因为小型语言模型并非在所有方面都表现良好。本文试图通过提出一个框架来弥合这一差距,该框架通过测量输出在三个实际方面的语义正确性(任务类型、应用领域和推理类型),并使用多样化的提示风格,在实验环境中评估小型开源语言模型。它还利用所提出的框架,对10个小型开源语言模型进行了深入比较,以根据特定应用需求确定最佳的语言模型和提示风格。我们还表明,如果选择得当,它们可以超越最先进的大型语言模型,如DeepSeek-v2、GPT-4o、GPT-4o-mini、Gemini-1.5-Pro,甚至与GPT-4o竞争。

关键词

引用

@article{arxiv.2406.11402,
  title  = {Are Small Language Models Ready to Compete with Large Language Models for Practical Applications?},
  author = {Neelabh Sinha and Vinija Jain and Aman Chadha},
  journal= {arXiv preprint arXiv:2406.11402},
  year   = {2025}
}

备注

Accepted at The Fifth Workshop on Trustworthy Natural Language Processing (TrustNLP 2025) in Annual Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics (NAACL), 2025. 8 pages + references + Appendix