提取与编码:利用大型语言模型与医学知识增强放射性文本表示
计算与语言
2024-07-03 v1 人工智能
机器学习
摘要
由于专业领域(如医学)的文本和图像专家标注稀缺,提升其表示学习仍面临挑战。为此,我们提出了一种新型双阶段框架,旨在从放射科报告的自由文本中提取高质量事实陈述,以改进文本编码器的表示,从而提升其在各种下游任务上的性能。第一阶段,我们提出了"事实提取器"(Fact Extractor),利用大型语言模型(LLM)从精心构建的领域特定数据集中识别事实陈述。第二阶段,我们引入了"事实编码器"(Fact Encoder, CXRFE),基于BERT模型进行微调,设计了旨在利用提取的事实数据提升其表示的目标函数。我们的框架还包括一种新的基于嵌入的指标(CXRFEScore),用于评估胸部X射线文本生成系统,综合运用了上述两个阶段的方法。广泛的评估表明,我们的事实提取器和编码器在句子排序、自然语言推理和从放射科报告中提取标签等任务中均超越当前最先进的方法。此外,所提指标在放射科报告生成文献中常用的现有指标之上,表现出更好的鲁棒性和有效性。该项目的代码已发布于 \url{https://github.com/PabloMessina/CXR-Fact-Encoder}。
引用
@article{arxiv.2407.01948,
title = {Extracting and Encoding: Leveraging Large Language Models and Medical Knowledge to Enhance Radiological Text Representation},
author = {Pablo Messina and René Vidal and Denis Parra and Álvaro Soto and Vladimir Araujo},
journal= {arXiv preprint arXiv:2407.01948},
year = {2024}
}
备注
Accepted to ACL 2024 (Findings)