中文

人类临床依据能否提高临床文本分类模型的性能与可解释性?

计算与语言 2025-07-30 v1

摘要

以 AI 为驱动的临床文本分类对于实现基于人群层面健康信息的可解释自动检索至关重要。本研究探讨人类依据的临床依据是否可作为额外的监督信息,以提高基于 Transformer 的模型在自动编码临床文档时的性能和可解释性。我们分析了 99,125 份人类依据的临床依据,这些依据为原发癌症部位诊断提供合理的解释,并将其作为额外的训练样本,与 128,649 份电子病理报告一起,用于评估基于 Transformer 的模型在提取原发癌症部位方面的表现。我们还研究了作为筛选依据质量的充分性度量方法。我们的结果表明,在高资源场景下,临床依据作为额外的训练数据可以提高模型性能,但在资源有限的情况下表现出不一致的行为。使用充分性作为自动化指标筛选依据也导致结果不一致。重要的是,使用依据训练的模型始终被额外的报告训练的模型所优于。这表明临床依据并不一致地提高模型性能,且不如仅使用更多报告那样有效。因此,如果目标是优化准确性,标注工作应侧重于标记更多报告,而非创建依据。然而,如果以可解释性为优先,训练基于依据补充数据的模型可能有助于其更好地识别类似依据的特征。我们得出结论,使用临床依据作为额外训练数据仅比使用额外报告训练略有性能提升,且仅在可解释性(以平均标记级依据覆盖率衡量)方面略有改善。

关键词

引用

@article{arxiv.2507.21302,
  title  = {Can human clinical rationales improve the performance and explainability of clinical text classification models?},
  author = {Christoph Metzner and Shang Gao and Drahomira Herrmannova and Heidi A. Hanson},
  journal= {arXiv preprint arXiv:2507.21302},
  year   = {2025}
}