中文

大语言模型用于从病理报告中可解释癌症分期的知识诱导

人工智能 2025-11-04 v1 医学物理

摘要

癌症分期对患者预后和治疗计划至关重要,但从非结构化病理报告中提取 TNM 分期仍是一个持续的挑战。现有的自然语言处理(NLP)和机器学习(ML)方法常常依赖大量标注数据,限制了其可扩展性和适应性。本研究引入两种知识诱导方法,以克服这些限制,使大语言模型(LLM)能够诱导并应用特定领域的规则进行癌症分期。第一种方法是基于长期记忆的知识诱导(KEwLTM),使用迭代提示策略直接从未标注的病理报告中推导分期规则,不需要参考地面真值标签。第二种方法是基于检索增强生成的知识诱导(KEwRAG),采用 RAG 的变体,其中规则一次性从相关指南中预提取,然后应用,从而增强可解释性,避免重复检索开销。我们利用 LLM 在预训练期间学习的广泛知识应用于新任务的能力。使用来自 TCGA 数据集的乳腺癌病理报告,我们评估了它们在识别 T 和 N 分期方面的性能,将其与各种基线方法在两个开源 LLM 上的结果进行比较。我们的结果表明,KEwLTM 在 Zero-Shot Chain-of-Thought(ZSCOT)推理有效时表现更好,而 KEwRAG 在 ZSCOT 推理不够理想时取得更好的性能。两种方法都通过使诱导规则显式化,提供透明且可解释的界面。这些发现凸显了我们的知识诱导方法作为具有增强可解释性的自动化癌症分期解决方案的前景,尤其是在标注数据有限的临床环境中。

关键词

引用

@article{arxiv.2511.01052,
  title  = {Knowledge Elicitation with Large Language Models for Interpretable Cancer Stage Identification from Pathology Reports},
  author = {Yeawon Lee and Christopher C. Yang and Chia-Hsuan Chang and Grace Lu-Yao},
  journal= {arXiv preprint arXiv:2511.01052},
  year   = {2025}
}