MultiADE:面向多域的不良事件抽取基准数据集
计算与语言
2024-11-26 v2
摘要
积极的不良事件监测从不同数据源(如电子健康记录、医学文献、社交媒体和搜索引擎日志)中监控不良药物事件(Adverse Drug Events, ADE)。多年来,已创建了许多数据集,并组织了共享任务,以促进积极的不良事件监测。然而,大多数——如果不是全部——数据集或共享任务都专注于从特定类型的文本中抽取ADE。域泛化——即机器学习模型在新且未见过的域(文本类型)上性能的能力——仍未得到充分探索。鉴于自然语言处理领域的快速发展,一个未被回答的问题是:我们离拥有一种在各种文本类型(如科学文献和社交媒体帖子)上都有效的单一ADE抽取模型还有多远?我们通过构建面向不良药物事件抽取的多域基准数据集来回答这一问题,命名为MultiADE。该新基准包含来自不同文本类型的几个现有数据集,以及我们新创建的数据集——CADECv2,这是CADEC的扩展,覆盖更多样化的药物的在线帖子。我们新创建的数据集遵循详细的标注指南由人类标注员仔细标注。我们的基准结果显示,训练模型的泛化性能远远不够理想,不可行用于处理不同类型的文本。此外,尽管中间迁移学习是一种利用现有资源的有前景的方法,但对于域适应方法的进一步探索仍然是一个问题,特别是针对选择有用训练实例的成本效益方法。新创建的CADECv2以及构建基准的脚本均可在CSIRO的数据门户上公开获取。
引用
@article{arxiv.2405.18015,
title = {MultiADE: A Multi-domain Benchmark for Adverse Drug Event Extraction},
author = {Xiang Dai and Sarvnaz Karimi and Abeed Sarker and Ben Hachey and Cecile Paris},
journal= {arXiv preprint arXiv:2405.18015},
year = {2024}
}
备注
Journal of Biomedical Informatics