自然语言模型: 解码自然界语言以实现科学发现
人工智能
2025-06-23 v3 机器学习
摘要
基础模型已 revolutionize 了自然语言处理和人工智能,显著增强了机器如何理解和生成人类语言的能力。受这些基础模型成功的启发,研究人员开发了针对单个科学领域的基础模型,包括小分子、材料、蛋白质、DNA、RNA甚至细胞。然而,这些模型通常在孤立环境中进行训练,缺乏跨不同科学领域的集成能力。鉴于这些领域的实体都可以表示为序列,彼此共同构成“自然语言”,我们引入了自然语言模型(NatureLM),这是一种面向科学发现的基于序列的科学基础模型。通过来自多个科学领域的数据进行预训练,NatureLM 提供了一个统一、多功能的模型,支持各种应用,包括:(i)使用文本指令生成和优化小分子、蛋白质、RNA和材料;(ii)跨域生成/设计,如蛋白质到分子和蛋白质到RNA的生成;(iii)在不同领域中实现顶尖性能,匹配或超越当前最先进的专家模型。NatureLM 为各种科学任务提供了有前景的通用方法,包括药物发现(靶点生成/优化、ADMET优化、合成)、新材料设计以及治疗性蛋白质或核苷酸的开发。我们开发了不同规模的NatureLM模型(10亿、80亿和467亿参数),并观察到随模型规模增加而性能明显提升。
引用
@article{arxiv.2502.07527,
title = {Nature Language Model: Deciphering the Language of Nature for Scientific Discovery},
author = {Yingce Xia and Peiran Jin and Shufang Xie and Liang He and Chuan Cao and Renqian Luo and Guoqing Liu and Yue Wang and Zequn Liu and Yuan-Jyue Chen and Zekun Guo and Yeqi Bai and Pan Deng and Yaosen Min and Ziheng Lu and Hongxia Hao and Han Yang and Jielan Li and Chang Liu and Jia Zhang and Jianwei Zhu and Ran Bi and Kehan Wu and Wei Zhang and Kaiyuan Gao and Qizhi Pei and Qian Wang and Xixian Liu and Yanting Li and Houtian Zhu and Yeqing Lu and Mingqian Ma and Zun Wang and Tian Xie and Krzysztof Maziarz and Marwin Segler and Zhao Yang and Zilong Chen and Yu Shi and Shuxin Zheng and Lijun Wu and Chen Hu and Peggy Dai and Tie-Yan Liu and Haiguang Liu and Tao Qin},
journal= {arXiv preprint arXiv:2502.07527},
year = {2025}
}
备注
95 pages