Geneverse:面向基因组和蛋白质组研究的开源多模态大语言模型合集
机器学习
2024-09-25 v1 人工智能
计算与语言
定量方法
摘要
大语言模型(LLM)的应用前景广阔,已在医学和健康领域广泛应用。尽管已有大量开源 LLM 基于广泛的医学数据进行训练,但针对基因组学和蛋白质组学的 LLM 应用研究仍有限。为填补这一空白,我们提出了一套称为 Geneverse 的微调 LLM 和多模态 LLM(MLLM)集合,用于基因组学和蛋白质组学研究中的三个新任务。Geneverse 中的模型基于领域特定数据集进行训练和评估,我们使用先进的参数高效微调技术来实现模型适配,包括:基因功能描述生成、基于蛋白质结构进行蛋白质功能推断以及从空间转录组数据中选择标记基因。我们展示了适配后的 LLM 和 MLLM 在这些任务中表现良好,可能超越封闭源大规模模型,具体取决于我们关注的真实性和结构正确性。我们使用的所有训练策略和基础模型均可 freely 访问。
引用
@article{arxiv.2406.15534,
title = {Geneverse: A collection of Open-source Multimodal Large Language Models for Genomic and Proteomic Research},
author = {Tianyu Liu and Yijia Xiao and Xiao Luo and Hua Xu and W. Jim Zheng and Hongyu Zhao},
journal= {arXiv preprint arXiv:2406.15534},
year = {2024}
}
备注
8 pages