透明度优先的医学语言模型:面向临床自然语言处理的数据表、模型卡与端到端数据溯源
计算与语言
2026-01-28 v1 机器学习
摘要
我们介绍了TeMLM,这是一套为临床语言模型设计的透明度优先的发布工件。TeMLM将溯源、数据透明度、建模透明度和治理统一到一个单一的、可机器检查的发布包中。我们定义了一套工件(TeMLM-Card、TeMLM-Datasheet、TeMLM-Provenance)和一个用于可重复审计的轻量级一致性检查表。我们在Technetium-I上实例化了这些工件,这是一个大规模合成临床自然语言处理数据集,包含498,000条记录,跨10种类型的774万个受保护健康信息实体标注,以及ICD-9-CM诊断标签,并报告了ProtactiniumBERT(约1亿参数)在PHI去标识化(令牌分类)和前50位ICD-9代码提取(多标签分类)上的参考结果。我们强调,合成基准对于工具和流程验证很有价值,但模型在部署前应在真实临床数据上进行验证。
引用
@article{arxiv.2601.19191,
title = {Transparency-First Medical Language Models: Datasheets, Model Cards, and End-to-End Data Provenance for Clinical NLP},
author = {Olaf Yunus Laitinen Imanov and Taner Yilmaz and Ayse Tuba Tugrul and Melike Nesrin Zaman and Ozkan Gunalp and Duygu Erisken and Sila Burde Dulger and Rana Irem Turhan and Izzet Ozdemir and Derya Umut Kulali and Ozan Akbulut and Harun Demircioglu and Hasan Basri Kara and Berfin Tavan},
journal= {arXiv preprint arXiv:2601.19191},
year = {2026}
}
备注
12 pages, 9 figures, 15 tables. Technetium-I case study and ProtactiniumBERT-100M reference benchmarks