中文

面向欧盟时序参考数据集的药物警戒信号检测方法绩效评估——基于大语言模型

计算与语言 2026-03-30 v1 定量方法

摘要

背景:药物警戒中最优信号检测方法的识别受限于可靠参考数据集的缺乏。现有数据集未能捕获不良事件(AE)由监管机构正式确认的时点,从而限制了分析局限于确认前期的可能性,亦限制了对早期检测绩效的评估。本研究通过开发面向欧盟时序索引参考数据集来弥补这一差距,该数据集包含 AE 被纳入产品标签的时间信息以及监管元数据。方法:检索欧盟药品注册中心(data lock: 2025 年 12 月 15 日)收录的全部中央批准药品(n=1,513)的当前及历史药品说明书(SmPC),使用 DeepSeek V3 提取第 4.8 节内容以识别 AE。从 SmPC 中程序化提取监管元数据,包括标签变更信息。基于 AE 被纳入 SmPC 的日期进行时序索引。结果:该数据库包含 17,763 份 SmPC 版本,覆盖 1995--2025 年,包含 125,026 条药物-AE 关联。限定于活跃药品的时序索引参考数据集包括 1,479 种药品和 110,823 条药物-AE 关联。大多数 AE 在上市前被识别(74.5%),而上市后被识别(25.5%)。安全更新在约 2012 年达到高峰。胃肠道、皮肤和神经系统障碍是最常见的系统器官类别(SOC)。药品中位数为 48 种 AE,涵盖 14 个 SOC。结论:该提议数据集在药物警戒中纳入 AE 识别的时序信息,弥补了欧盟的关键性差距,支持更准确的信号检测绩效评估,并促进跨分析方法的方法学比较。

关键词

引用

@article{arxiv.2603.26544,
  title  = {Development of a European Union Time-Indexed Reference Dataset for Assessing the Performance of Signal Detection Methods in Pharmacovigilance using a Large Language Model},
  author = {Maria Kefala and Jeffery L. Painter and Syed Tauhid Bukhari and Maurizio Sessa},
  journal= {arXiv preprint arXiv:2603.26544},
  year   = {2026}
}

备注

4 Figures and 2 Tables