Text2MDT:从医学文本中提取医学决策树
计算与语言
2024-01-05 v1
摘要
医学决策过程的知识可以建模为医学决策树(MDT),这对于构建临床决策支持系统至关重要。然而,当前的MDT构建方法严重依赖耗时且费力的手动标注。在这项工作中,我们提出了一项新任务Text2MDT,旨在探索从医学文本(如医学指南和教科书)中自动提取MDT。我们规范了MDT的形式,并在医学专家的参与下创建了一个带标注的中文Text-to-MDT数据集。我们研究了两种不同的Text2MDT任务方法:(a) 一个端到端框架,仅依赖GPT风格的大语言模型(LLM)指令微调来生成所有节点信息和树结构。(b) 流水线框架,将Text2MDT任务分解为三个子任务。在我们的Text2MDT数据集上的实验表明:(a) 基于LLM(7B参数或更大)的端到端方法显示出有希望的结果,并成功优于流水线方法。(b) 思维链(COT)提示方法\cite{Wei2022ChainOT}可以提高微调后的LLM在Text2MDT测试集上的性能。(c) 基于编码器预训练模型的轻量级流水线方法可以在模型复杂度小两个数量级的情况下与LLM性能相当。我们的Text2MDT数据集在\url{https://tianchi.aliyun.com/dataset/95414}开源,源代码在\url{https://github.com/michael-wzhu/text2dt}开源。
引用
@article{arxiv.2401.02034,
title = {Text2MDT: Extracting Medical Decision Trees from Medical Texts},
author = {Wei Zhu and Wenfeng Li and Xing Tian and Pengfei Wang and Xiaoling Wang and Jin Chen and Yuanbin Wu and Yuan Ni and Guotong Xie},
journal= {arXiv preprint arXiv:2401.02034},
year = {2024}
}