PQA:基于大语言模型的自由形式科学查询零样本蛋白质问答
机器学习
2024-11-20 v2
摘要
理解蛋白质的结构与功能在生物学中至关重要。然而,当前的计算方法通常是特定于任务的且资源消耗大。为了解决这一问题,我们提出了零样本蛋白质问答(PQA),这是一项旨在无需特定任务训练即可回答广泛蛋白质相关查询的任务。PQA 的成功依赖于高质量的数据集和稳健的评估策略,而这两者在当前研究中均有所欠缺。现有数据集存在偏差、噪声以及缺乏进化上下文的问题,而当前的评估方法无法准确评估模型性能。我们引入了 Pika 框架以克服这些局限性。Pika 包含一个专为 PQA 策划的去偏数据集和一种生物化学相关的基准测试策略。我们还提出将多模态大语言模型作为 PQA 的强基线,利用其自然语言处理能力和知识。该方法有望提供一种更灵活、更高效的方式来探索蛋白质特性,从而推动蛋白质研究。我们包含数据集、代码和模型检查点的完整 PQA 框架 Pika 已在 github.com/EMCarrami/Pika 上公开访问,以促进该领域更广泛的研究。
引用
@article{arxiv.2402.13653,
title = {PQA: Zero-shot Protein Question Answering for Free-form Scientific Enquiry with Large Language Models},
author = {Eli M Carrami and Sahand Sharifzadeh},
journal= {arXiv preprint arXiv:2402.13653},
year = {2024}
}