上下文特定语言模型的优势:Erasmian语言模型的案例
计算与语言
2025-04-24 v2 人工智能
摘要
当前提升语言模型性能的趋势似乎基于参数数量的扩展(例如,最先进的GPT4模型约有1.7万亿个参数)或输入模型的训练数据量。然而这在计算资源和能源成本方面带来了显著代价,损害了AI解决方案的可持续性,同时也带来了隐私和滥用的风险。在本文中,我们提出了Erasmian语言模型(ELM),一个小的上下文特定、9亿参数的模型,由鹿特丹伊拉斯谟大学为其进行预训练和微调。我们展示了该模型在课堂环境中用于作文写作时的充分表现,以及它在属于其上下文的学科中取得的优异性能。这对广泛机构和组织具有启示意义,表明上下文特定语言模型可能是资源受限、隐私敏感用例的可行替代方案。
引用
@article{arxiv.2408.06931,
title = {The advantages of context specific language models: the case of the Erasmian Language Model},
author = {João Gonçalves and Nick Jelicic and Michele Murgia and Evert Stamhuis},
journal= {arXiv preprint arXiv:2408.06931},
year = {2025}
}
备注
12 pages, 3 figures, 1 table