中文

DAEDRA:一种用于预测被动药物警戒报告中结局的语言模型

计算与语言 2024-02-20 v1 机器学习

摘要

近年来,大型语言模型 (LLM) 的出现催生了大量领域专用模型的涌现,这些模型旨在反映作为起源领域相关性的语言语境和内容的特殊性。本文详细介绍了 DAEDRA 的构思、设计、训练和评估,这是一种旨在检测通过被动报告 (PR) 引发的不良事件报告中与监管相关的结局(死亡率、急诊就诊和住院)的 LLM。虽然 PR 是一种从广泛且多样的受众(通常不仅包括医生和医疗保健提供者,还包括患者、家庭成员和其他非专业利益相关者)中获取信息的高成本效益方式,但这种多样性使得 PR 语料库难以分析。通用语言模型可能无法捕捉复杂的临床维度,而特定的临床或生物医学模型可能在非专业报告上表现不佳。为了评估子领域专用语言模型的效用,我们采用了一种自适应训练方法,即在语料库的子集上评估基础语言模型候选者,并在整个语料库上训练表现最佳者。这在相对较低的训练成本和单日的训练时间内,带来了 F1F_1 (+1%)、精确率 (+2.5%) 和召回率 (+3.8%) 的小幅但显著的提升。在分析高度专业化的语料库时,子领域专用的 LLM 仍然是获得更好结果的可行选择。

关键词

引用

@article{arxiv.2402.10951,
  title  = {DAEDRA: A language model for predicting outcomes in passive pharmacovigilance reporting},
  author = {Chris von Csefalvay},
  journal= {arXiv preprint arXiv:2402.10951},
  year   = {2024}
}