中文

LitSumm:用于非编码 RNA 文献摘要的大语言模型

基因组学 2025-01-13 v4 人工智能

摘要

生命科学领域的文献整理是一项日益严峻的挑战。全球出版物数量的持续增长,加之策展人数量相对固定,给生物医学知识库的开发者带来了重大挑战。极少有知识库具备资源覆盖全部相关文献,所有知识库都不得不对其工作排定优先级。在本工作中,我们迈出第一步,利用大语言模型(LLMs)为非编码 RNA 生成文献摘要,以缓解 RNA 科学领域策展人时间不足的问题。我们证明,借助商业 LLM 以及一系列提示与校验流程,可从文献中自动生成高质量、事实准确且引用无误的摘要。我们对部分摘要进行了人工评估,其中大多数被评为极高质量。我们将该工具应用于超过 4,600 个 ncRNA 的选择集,并通过 RNAcentral 资源提供所生成的摘要。我们得出结论:只要采用审慎的提示设计与自动化校验,利用当前一代 LLM 实现自动化文献摘要是可行的。

关键词

引用

@article{arxiv.2311.03056,
  title  = {LitSumm: Large language models for literature summarisation of non-coding RNAs},
  author = {Andrew Green and Carlos Ribas and Nancy Ontiveros-Palacios and Sam Griffiths-Jones and Anton I. Petrov and Alex Bateman and Blake Sweeney},
  journal= {arXiv preprint arXiv:2311.03056},
  year   = {2025}
}