未充分探索生物医学领域中的关系抽取:多样性优化采样与合成数据生成方法
计算与语言
2023-11-14 v1
摘要
标注数据的稀疏性是关系抽取模型开发与多个生物医学领域数据库完备的障碍。天然产物文献报道从生物中识别潜在生物活性化合物,作为药物发现中备受关注却确被忽视的主题,是此类问题的具体例证。为标志这一新任务的起点,我们创建了首个精选评估数据集,并从 LOTUS 数据库抽取文献条目以构建训练集。为此,我们开发了受生态学多样性指标启发的新采样器,名为贪婪最大熵采样器(Greedy Maximum Entropy sampler,或 GME-sampler,https://github.com/idiap/gme-sampler)。鉴于人工标注的资源密集型性质,对评估集中所选条目的平衡性与多样性进行策略优化十分重要。在量化训练集中以输入摘要文本与预期输出标签间不一致形式存在的噪声后,我们相应探索了不同策略。将该任务框定为端到端关系抽取,我们评估了作为生成任务的标准微调性能,以及使用开放大语言模型(LLaMA 7B-65B)的少样本学习。除在少样本设置中评估外,我们探索了开放大语言模型(Vicuna-13B)作为合成数据生成器的潜力,并为此提出新工作流。所有评估模型在基于合成摘要而非原始噪声数据微调时均展现出实质改进。我们提供了性能最佳(f1-score=59.0)的 BioGPT-Large 模型用于天然产物关系的端到端关系抽取,以及所有生成的合成数据与评估数据集。更多细节见 https://github.com/idiap/abroad-re。
引用
@article{arxiv.2311.06364,
title = {Relation Extraction in underexplored biomedical domains: A diversity-optimised sampling and synthetic data generation approach},
author = {Maxime Delmas and Magdalena Wysocka and André Freitas},
journal= {arXiv preprint arXiv:2311.06364},
year = {2023}
}