中文

大规模从无结构媒介中挖掘药物不良反应

计算与语言 2022-01-07 v2 人工智能 机器学习

摘要

药物不良反应/事件(ADR/ADE)对患者健康与医疗成本有重大影响。尽早检测 ADR 并与监管机构、制药公司及医疗服务提供者共享,可预防发病并挽救许多生命。虽然大多数 ADR 未通过正式渠道报告,但它们常记录于各类无结构对话中,如患者的社交媒体帖子、客户支持通话转录文本,或医疗服务提供者与医药销售代表会议的 CRM 笔记。本文提出一种自然语言处理(NLP)方案,用于检测此类无结构自由文本对话中的 ADR,其在三方面优于先前工作。首先,一个新的命名实体识别(NER)模型在 ADE、CADEC 和 SMM4H 基准数据集上取得 ADR 与药物实体抽取的新最优精度(F1 分数分别为 91.75%、78.76% 和 83.41%)。其次,引入两种新的关系抽取(RE)模型——一种基于 BioBERT,另一种在全连接神经网络(FCNN)上使用人工构造特征——被证明与现有最优模型性能相当,且在使用临床医生标注的 supplementary RE 数据集训练时优于它们。第三,一个新的文本分类模型用于判断对话是否包含 ADR,在 CADEC 数据集上取得新最优精度(F1 分数 86.69%)。完整方案作为统一 NLP 流水线实现于构建在 Apache Spark 之上的生产级库中,使其天然可扩展并能在商用集群上处理数百万批量或流式记录。

关键词

引用

@article{arxiv.2201.01405,
  title  = {Mining Adverse Drug Reactions from Unstructured Mediums at Scale},
  author = {Hasham Ul Haq and Veysel Kocaman and David Talby},
  journal= {arXiv preprint arXiv:2201.01405},
  year   = {2022}
}

备注

Accepted to W3PHIAI workshop at AAAI-22