中文

Galactica:一个面向科学的大型语言模型

计算与语言 2022-11-17 v1 机器学习

摘要

信息过载是科学进步的主要障碍。科学文献和数据的爆炸式增长使得在大量信息中发现有用见解变得愈发困难。如今科学知识通过搜索引擎获取,但它们无法独自组织科学知识。在本文中我们介绍Galactica:一个能够存储、组合和推理科学知识的语言模型。我们在一个由论文、参考资料、知识库和许多其他来源组成的大型科学语料库上训练。我们在一系列科学任务上超越现有模型。在LaTeX公式等技术知识探测上,Galactica以68.2%对49.0%优于最新的GPT-3。Galactica在推理上也表现良好,以41.3%对35.7%在数学MMLU上超越Chinchilla,并以20.4%对8.8%在MATH上超越PaLM 540B。它还在PubMedQA和MedMCQA dev等下游任务上创下新的SOTA,分别为77.6%和52.9%。并且尽管未在通用语料上训练,Galactica在BIG-bench上优于BLOOM和OPT-175B。我们相信这些结果展示了语言模型作为科学新接口的潜力。我们为科学界的利益开源了该模型。

关键词

引用

@article{arxiv.2211.09085,
  title  = {Galactica: A Large Language Model for Science},
  author = {Ross Taylor and Marcin Kardas and Guillem Cucurull and Thomas Scialom and Anthony Hartshorn and Elvis Saravia and Andrew Poulton and Viktor Kerkez and Robert Stojnic},
  journal= {arXiv preprint arXiv:2211.09085},
  year   = {2022}
}