ClimateGPT:迈向AI综合气候变化跨学科研究
机器学习
2024-01-19 v1 人工智能
计算与语言
摘要
本文介绍了ClimateGPT,一个领域特定的大语言模型家族,用于综合气候变化跨学科研究。我们在一个包含300B token的科学导向数据集上从头训练了两个7B模型。对于第一个模型,4.2B领域特定token在预训练期间被包含;第二个模型在预训练后适应到气候领域。此外,ClimateGPT-7B、13B和70B从Llama~2在4.2B token的领域特定数据集上持续预训练。每个模型都在与气候科学家密切合作创建的高质量、人工生成的领域特定数据集上进行指令微调。为了减少幻觉数量,我们优化了模型的检索增强,并提出了层次化检索策略。为了提高模型对非英语使用者的可访问性,我们提出利用级联机器翻译,并表明该方法可以与原生多语言模型性能相当,同时更容易扩展到大量语言。此外,为了应对气候变化固有的跨学科性,我们考虑了不同的研究视角。因此,模型除了提供整体答案外,还可以生成聚焦于不同视角的深入答案。我们提出了一套自动的气候特定基准来评估LLM。在这些基准上,ClimateGPT-7B的性能与十倍大的Llama-2-70B Chat模型相当,同时在通用领域基准上没有性能下降。我们的人工评估证实了基准中观察到的趋势。所有模型均使用可再生能源进行训练和评估,并公开发布。
引用
@article{arxiv.2401.09646,
title = {ClimateGPT: Towards AI Synthesizing Interdisciplinary Research on Climate Change},
author = {David Thulke and Yingbo Gao and Petrus Pelser and Rein Brune and Rricha Jalota and Floris Fok and Michael Ramos and Ian van Wyk and Abdallah Nasir and Hayden Goldstein and Taylor Tragemann and Katie Nguyen and Ariana Fowler and Andrew Stanco and Jon Gabriel and Jordan Taylor and Dean Moro and Evgenii Tsymbalov and Juliette de Waal and Evgeny Matusov and Mudar Yaghi and Mohammad Shihadah and Hermann Ney and Christian Dugast and Jonathan Dotan and Daniel Erasmus},
journal= {arXiv preprint arXiv:2401.09646},
year = {2024}
}