临床试验记录中数据共享声明的分类器
计算与语言
2025-02-19 v1 人工智能
摘要
来自临床试验的数字个体参与者数据(IPD)正越来越多地被分发用于潜在的科学再利用。然而,识别可用的IPD需要对大型数据库中的文本数据共享声明(DSS)进行解读。计算语言学的最新进展包括预训练语言模型,它们有望简化基于文本输入的有效分类器的实现。在来自ClinicalTrials.gov的5000条文本DSS子集中,我们评估了基于领域特定预训练语言模型的分类器在复现原始可用性类别以及手动标注标签方面的表现。典型指标表明,预测手动标注的分类器优于那些学习输出原始可用性类别的分类器。这表明文本DSS描述中包含可用性类别所不具备的可用信息,因此此类分类器可以辅助在大型试验数据库中自动识别可用的IPD。
引用
@article{arxiv.2502.12362,
title = {Classifiers of Data Sharing Statements in Clinical Trial Records},
author = {Saber Jelodari Mamaghani and Cosima Strantz and Dennis Toddenroth},
journal= {arXiv preprint arXiv:2502.12362},
year = {2025}
}
备注
Published in Proceedings of MIE 2024, IOS Press eBooks. Studies in Health Technology and Informatics, Vol. 316, pp. 834-838. Conference held in Athens, Greece