中文

跨司法管辖区自然语言处理模型适配:加拿大癌症登记册中的一项试点研究

计算与语言 2026-01-05 v1

摘要

基于人口的癌症登记册依赖病理报告作为主要诊断来源,但人工抽象耗时且导致癌症数据延迟。虽然基于Transformer的NLP系统已改善登记流程,但其在不同报告惯例的司法管辖区间的泛化能力尚不明了。我们首次对比评估了在不列颠哥伦比亚省癌症登记处开发的BCCRTron模型与生物医学Transformer模型GatorTron,用于加拿大癌症监测。训练数据来自纽芬兰与拉贝尔省癌症登记册(NLCR)的约104,000份和22,000份去标识化病理报告,分别用于Tier 1(癌症 vs 非癌症)和Tier 2(可报告性癌症 vs 不可报告性癌症)任务。两种模型分别采用补充的综合描述和诊断聚焦报告章节输入管道进行微调。在NLCR测试集上,适配后的模型保持了高性能,表明在一司法管辖区预训练的Transformer模型可通过适度微调 localized 到另一司法管辖区。为提高灵敏度,我们采用保守的OR集成组合两种模型,Tier 1召回率达0.99,将漏检癌症减少至24例(较单独模型的48例和54例显著降低);Tier 2召回率同样达0.99,将漏检可报告性癌症减少至33例(较单独模型的54例和46例明显减少)。这些发现表明,结合互补文本表示的集成显著降低漏检癌症并提升癌症登记NLP的错误覆盖范围。我们实现了一种隐私保护工作流程,仅在省份之间共享模型权重,支持可互操作的NLP基础设施及未来加拿大全国癌症病理与登记流程的基础模型。

关键词

引用

@article{arxiv.2601.00787,
  title  = {Adapting Natural Language Processing Models Across Jurisdictions: A pilot Study in Canadian Cancer Registries},
  author = {Jonathan Simkin and Lovedeep Gondara and Zeeshan Rizvi and Gregory Doyle and Jeff Dowden and Dan Bond and Desmond Martin and Raymond Ng},
  journal= {arXiv preprint arXiv:2601.00787},
  year   = {2026}
}