基于 BERT 的模型在植物健康公报分类中的微调
计算与语言
2021-02-02 v1
摘要
在数字化时代,农业中的不同参与者产生了大量数据。这些数据已包含该领域潜在的历史知识。这些知识使我们能够从全球或局部角度精确研究自然灾害,进而改进风险防范任务并提高产量,有助于应对人口增长和饮食习惯变化带来的挑战。特别是,法国植物健康公报(BSV,法语全称为 Bulletin de Santé du Végétal)提供了关于农业生产中植保风险发展阶段的信息。然而,它们以自然语言书写,因此机器和人类无法尽可能高效地利用它们。自然语言处理(NLP)技术旨在自动处理和分析大量自然语言数据。自2010年代以来,随着计算能力和并行化的提升,表示学习与深度学习方法在 NLP 中广泛普及。近期双向编码器表示来自 Transformer(BERT)的进展启发我们重新思考植物健康管理领域的知识表示与自然语言理解。本工作的目标是提出一种基于 BERT 的方法,自动对 BSV 进行分类以使其数据易于索引。我们抽取了 200 份 BSV 来微调预训练的 BERT 语言模型,并将其分类为害虫和/或病害,并展示了初步结果。
引用
@article{arxiv.2102.00838,
title = {Fine-tuning BERT-based models for Plant Health Bulletin Classification},
author = {Shufan Jiang and Rafael Angarita and Stephane Cormier and Francis Rousseaux},
journal= {arXiv preprint arXiv:2102.00838},
year = {2021}
}