面向基于机器学习的短语抽取与验证的科学文本自动标注
信息检索
2024-10-01 v1 人工智能
机器学习
基因组学
摘要
先进的组学技术与设施每天产生大量宝贵数据;然而,这些数据常缺乏研究人员有效查找和检索所需的必要元数据。元数据缺失对这些数据集的利用构成重大挑战。基于机器学习的元数据抽取技术已成为一种潜在可行的方法,可自动以有效检索所需的元数据标注科学数据集。文本标注(通常手动执行)在验证机器抽取的元数据中起关键作用。然而,手动标注耗时;因此,有必要开发自动文本标注技术以加速科学创新进程。这一需求在环境基因组学和微生物组科学等领域尤为紧迫,这些领域在元数据整理和黄金标准文本挖掘数据集创建方面历来受关注较少。本文中,我们提出两种新颖的自动文本标注方法,用于验证未标注文本的机器学习生成元数据,并在环境基因组学中有具体应用。我们的技术展示了利用关于未标注文本和科学领域的现有信息的两种新途径的潜力。第一种技术利用同一研究相关的不同数据源(如出版物与提案)间的关系。第二种技术利用领域特定的受控词汇表或本体。本文中,我们详述了将这些方法应用于机器学习生成元数据验证。结果显示,所提出的标签分配方法可为未标注文本生成通用且高度特定的文本标签,多达 44% 的标签与机器学习关键词抽取算法建议的标签匹配。
引用
@article{arxiv.2311.05042,
title = {Automated Annotation of Scientific Texts for ML-based Keyphrase Extraction and Validation},
author = {Oluwamayowa O. Amusat and Harshad Hegde and Christopher J. Mungall and Anna Giannakou and Neil P. Byers and Dan Gunter and Kjiersten Fagnan and Lavanya Ramakrishnan},
journal= {arXiv preprint arXiv:2311.05042},
year = {2024}
}
备注
33 pages, 6 figures, 10 tables