中文

基于NLP技术的肺癌和乳腺癌报告中临床实体的自动检测

计算与语言 2025-05-16 v1 人工智能

摘要

研究项目,包括专注于癌症的项目,依赖于从临床报告中手动提取信息。该过程耗时且容易出错,限制了数据驱动方法在医疗保健领域的效率。为应对这些挑战,自然语言处理(NLP)提供了一种自动从电子健康记录(EHR)中提取相关数据的替代方案。本研究聚焦于肺癌和乳腺癌,因为这两种癌症发病率高且对公共卫生影响巨大。早期检测和有效的数据管理对于改善患者预后至关重要。为提高数据提取的准确性和效率,我们利用GMV的NLP工具uQuery,该工具在识别临床文本中的相关实体并将其转换为标准格式(如SNOMED和OMOP)方面表现出色。uQuery不仅检测和分类实体,还将其与上下文信息关联,包括否定实体、时间方面以及患者相关细节。在本工作中,我们探讨了使用NLP技术, Specifically命名实体识别(NER),自动识别和提取与这两种癌症相关的EHR中的关键临床信息。来自Health Research Institute Hospital La Fe(IIS La Fe)的数据集用于本研究,包括200份标注的乳腺癌报告和400份肺癌报告,使用Doccano平台手动标记了八个临床实体。为进行NER,我们对bsc-bio-ehr-en3模型进行了微调,该模型是基于RoBERTa的生物医学语言模型,在西班牙语上预训练。通过使用Transformers架构进行微调,可实现对这些癌症类型的临床实体的准确识别。我们的结果显示出色的整体性能,特别是在识别像MET和PAT这样的实体方面,尽管对于较少出现的实体如EVOL仍面临挑战。

关键词

引用

@article{arxiv.2505.09794,
  title  = {Automated Detection of Clinical Entities in Lung and Breast Cancer Reports Using NLP Techniques},
  author = {J. Moreno-Casanova and J. M. Auñón and A. Mártinez-Pérez and M. E. Pérez-Martínez and M. E. Gas-López},
  journal= {arXiv preprint arXiv:2505.09794},
  year   = {2025}
}