中文

基于提示的大语言模型在生物信息学NLP多任务上的基准测试

机器人学 2025-09-23 v2

摘要

大语言模型(LLMs)已成为解决生物学问题的重要工具,在准确性和适应性方面优于传统方法。已提出若干基准来评估这些LLM的性能。然而,当前基准难以有效评估这些模型在多样化任务上的表现。在本文中,我们引入了一个全面的基于提示的基准测试框架——Bio-benchmark,涵盖30个关键生物信息学任务,涉及蛋白质、RNA、药物、电子健康记录和传统中医等领域。利用该基准,我们使用0-shot和少量样本的思维链(CoT)设置(无需微调)评估了六个主流LLM,包括GPT-4o和Llama-3.1-70b等,以揭示其内在能力。为提高评估效率,我们展示了BioFinder——一个从LLM响应中提取答案的新工具,其提取准确率相比现有方法提升了约30%。我们的基准测试结果揭示了当前LLM适合处理的生物任务,并识别出需要改进的特定领域。此外,我们提出了针对性的提示工程策略以优化LLM在这些场景中的表现。基于这些发现,我们为开发更鲁棒的、面向各种生物应用的LLM提供了建议。本工作提供了一个全面的评估框架和稳健的工具,以支持LLM在生物信息学中的应用。

关键词

引用

@article{arxiv.2503.04014,
  title  = {Dexterous Grasping with Real-World Robotic Reinforcement Learning},
  author = {Dongchi Huang and Tianle Zhang and Yihang Li and Ling Zhao and Jiayi Li and Zhirui Fang and Chunhe Xia and Xiaodong He},
  journal= {arXiv preprint arXiv:2503.04014},
  year   = {2025}
}