从生物医学文献中自动抽取实验方法
计算与语言
2024-04-23 v1 机器学习
摘要
生物医学文献是快速扩张的科学技术领域。生物医学文本的分类是生物医学研究的关键环节,尤其在生物学领域。本工作提出了使用经过微调的DistilBERT,这是一种针对特定方法的、预训练的生成式分类语言模型,用于从生物医学文本中挖掘方法信息。该模型在语言理解能力方面证明了有效性,同时将BERT模型的规模缩小了40%,但速度提高了60%。本项目的主要目标是改进该模型并评估与非微调模型相比的性能。我们使用DistilBERT作为支持模型,并在32,000篇摘要和完整文本文章上进行预训练;我们的结果令人印象深刻,超过了使用RNN或LSTM的传统文献分类方法。我们的目标是将这一高度专业化和特定化的模型集成到不同的研究行业中。
引用
@article{arxiv.2404.13779,
title = {Automated Text Mining of Experimental Methodologies from Biomedical Literature},
author = {Ziqing Guo},
journal= {arXiv preprint arXiv:2404.13779},
year = {2024}
}