中文

评估领先大语言模型在生物推理问题中的潜力

计算与语言 2023-11-15 v1 人工智能

摘要

大语言模型(LLMs)的最新进展为将通用人工智能(AGI)融入生物研究与教育带来了新机遇。本研究评估了包括 GPT-4、GPT-3.5、PaLM2、Claude2 和 SenseNova 在内的领先 LLMs 在回答概念性生物问题方面的能力。这些模型在涵盖分子生物学、生物技术、代谢工程和合成生物学等生物主题的 108 道选择题考试上进行了测试。其中,GPT-4 以 90 分的平均分最高,并在不同提示的多次试验中表现出最佳一致性。结果表明 GPT-4 在逻辑推理方面的熟练度,以及其通过数据分析、假设生成和知识整合等能力辅助生物研究的潜力。然而,在 LLMs 加速生物发现的愿景实现之前,仍需进一步的开发与验证。

关键词

引用

@article{arxiv.2311.07582,
  title  = {Evaluating the Potential of Leading Large Language Models in Reasoning Biology Questions},
  author = {Xinyu Gong and Jason Holmes and Yiwei Li and Zhengliang Liu and Qi Gan and Zihao Wu and Jianli Zhang and Yusong Zou and Yuxi Teng and Tian Jiang and Hongtu Zhu and Wei Liu and Tianming Liu and Yajun Yan},
  journal= {arXiv preprint arXiv:2311.07582},
  year   = {2023}
}