中文

ODD:一个基于自然语言处理的阿片类药物相关异常行为检测基准数据集

计算与语言 2024-03-26 v4 人工智能

摘要

阿片类药物相关异常行为(ORABs)是阿片类药物过量的新风险因素。本文介绍了一个名为ODD(ORAB检测数据集,ORAB Detection Dataset)的新型生物医学自然语言处理基准数据集。ODD是一个专家标注的数据集,旨在从患者的电子健康记录(EHR)笔记中识别ORABs并将其分为九类:1)确认的异常行为,2)提示的异常行为,3)阿片类药物,4)适应症,5)确诊的阿片类药物依赖,6)苯二氮䓬类药物,7)用药变更,8)中枢神经系统相关,以及9)健康的社会决定因素。我们探索了两种最先进的自然语言处理模型(微调与提示微调方法)来识别ORAB。实验结果表明,提示微调模型在大多数类别上优于微调模型,且在罕见类别(提示的异常行为、确认的异常行为、确诊的阿片类药物依赖和用药变更)上的提升尤为显著。尽管最佳模型在宏平均精确率-召回率曲线下面积上取得了最高的88.17%,罕见类别仍有很大的性能提升空间。ODD已公开可用。

关键词

引用

@article{arxiv.2307.02591,
  title  = {ODD: A Benchmark Dataset for the Natural Language Processing based Opioid Related Aberrant Behavior Detection},
  author = {Sunjae Kwon and Xun Wang and Weisong Liu and Emily Druhl and Minhee L. Sung and Joel I. Reisman and Wenjun Li and Robert D. Kerns and William Becker and Hong Yu},
  journal= {arXiv preprint arXiv:2307.02591},
  year   = {2024}
}

备注

To be appeared at NAACL 2024