中文

临床试验叙述中给药错误的自动检测:基于 LightGBM 的多模态特征工程方法

人工智能 2026-04-23 v1 计算与语言

摘要

临床试验要求严格遵守用药方案,但给药错误仍是一个影响患者安全和试验完整性的长期挑战。我们提出了一种自动化系统,利用梯度提升与全面的多模态特征工程,从非结构化临床试验叙述中检测给药错误。该方法结合了 3,451 个特征,涵盖传统 NLP(TF-IDF、字符 n-grams)、稠密语义嵌入(all-MiniLM-L6v2)、特定领域医学模式以及基于 Transformer 的评分(BiomedBERT、DeBERTa-v3),用于训练 LightGBM 模型。特征从九个互补的文本字段中提取(每个样本中位数为 5,400 个字符),确保覆盖所有 42,112 份临床试验叙述。在存在严重类别不平衡(4.9% 阳性率)的 CT-DEB 基准数据集上,我们通过 5 折集成平均实现了 0.8725 的测试 ROC-AUC(交叉验证:0.8833 + 0.0091 AUC)。系统性消融研究表明,移除句子嵌入会导致最大的性能下降(2.39%),证明其尽管仅贡献了 37.07% 的总特征重要性,但仍发挥着关键作用。特征效率分析表明,选择前 500-1000 个特征可产生最佳性能(0.886-0.887 AUC),通过有效的噪声抑制优于完整的 3,451 特征集(0.879 AUC)。我们的发现突出了特征选择作为一种正则化技术的重要性,并证明在严重的类别不平衡下,稀疏词汇特征与稠密表示在专业临床文本分类中仍具有互补性。

关键词

引用

@article{arxiv.2604.19759,
  title  = {Automated Detection of Dosing Errors in Clinical Trial Narratives: A Multi-Modal Feature Engineering Approach with LightGBM},
  author = {Mohammad AL-Smadi},
  journal= {arXiv preprint arXiv:2604.19759},
  year   = {2026}
}

备注

Accepted for CL4Health 2026, LREC26 conference