PlantDeBERTa:面向植物科学的开源语言模型
计算与语言
2025-08-20 v4 人工智能
摘要
基于Transformer的语言模型的快速发展推动了生物医学和临床自然语言处理领域的突破;然而,植物科学领域仍明显缺乏此类领域自适应工具。在本工作中,我们提出了PlantDeBERTa,一个高性能、开源的语言模型,专门用于从植物胁迫响应文献中提取结构化知识。PlantDeBERTa基于DeBERTa架构构建——该架构以其解耦注意力和强大的上下文编码能力著称——并在精心策划的专家标注摘要语料库上进行了微调,主要聚焦于小豆(Lens culinaris)对多种非生物和生物胁迫因子的响应。我们的方法将基于Transformer的建模与规则增强的语言学后处理以及基于本体的实体归一化相结合,使PlantDeBERTa能够精确且语义忠实地捕捉生物学上有意义的关系。底层语料库使用与Crop Ontology对齐的分层模式进行标注,涵盖了植物适应的分子、生理、生化和农艺维度。PlantDeBERTa在实体类型上展现出强大的泛化能力,并证明了在低资源科学领域进行鲁棒领域自适应的可行性。通过提供一个可扩展且可复现的高分辨率实体识别框架,PlantDeBERTa弥合了农业自然语言处理中的关键空白,为植物基因组学、表型组和农学知识发现中的智能、数据驱动系统铺平了道路。我们的模型公开发布,以促进透明度并加速计算植物科学中的跨学科创新。
引用
@article{arxiv.2506.08897,
title = {PlantDeBERTa: An Open Source Language Model for Plant Science},
author = {Hiba Khey and Amine Lakhder and Salma Rouichi and Imane El Ghabi and Kamal Hejjaoui and Younes En-nahli and Fahd Kalloubi and Moez Amri},
journal= {arXiv preprint arXiv:2506.08897},
year = {2025}
}