科学大语言模型:生物与化学领域综述
计算与语言
2024-07-24 v2
摘要
大语言模型 (Large Language Models, LLMs) 已成为增强自然语言理解能力的变革性力量,代表着迈向通用人工智能的重要一步。LLM 的应用超越了传统的语言边界,涵盖了各科学学科内发展的专业语言系统。这种日益增长的兴趣催生了科学大语言模型,这是一个专为促进科学发现而设计的新型子类。作为 AI for Science 社区中一个新兴领域,科学大语言模型值得全面探索。然而,目前尚缺乏对其进行介绍的系统性且最新的综述。本文致力于系统性地界定“科学语言”的概念,同时对科学大语言模型的最新进展进行全面回顾。鉴于科学学科的广阔领域,我们的分析聚焦于生物和化学领域。这包括深入审视用于文本知识、小分子、大分子蛋白质、基因组序列及其组合的 LLM,从模型架构、能力、数据集和评估方面进行分析。最后,我们批判性地审视了当前存在的挑战,并结合 LLM 的进展指出了有前景的研究方向。通过提供该领域技术发展的全面概览,本综述旨在成为研究人员探索科学大语言模型复杂图景的宝贵资源。
引用
@article{arxiv.2401.14656,
title = {Scientific Large Language Models: A Survey on Biological & Chemical Domains},
author = {Qiang Zhang and Keyang Ding and Tianwen Lyv and Xinda Wang and Qingyu Yin and Yiwen Zhang and Jing Yu and Yuhao Wang and Xiaotong Li and Zhuoyi Xiang and Kehua Feng and Xiang Zhuang and Zeyuan Wang and Ming Qin and Mengyao Zhang and Jinlu Zhang and Jiyu Cui and Tao Huang and Pengju Yan and Renjun Xu and Hongyang Chen and Xiaolin Li and Xiaohui Fan and Huabin Xing and Huajun Chen},
journal= {arXiv preprint arXiv:2401.14656},
year = {2024}
}