中文

TCM-SD:面向自然语言处理辨证的基准数据集

计算与语言 2022-08-04 v2 人工智能 计算机与社会

摘要

中医(TCM)是一种自然、安全且有效的疗法,已在世界范围内传播和应用。中医独特的诊疗体系需要对以自由文本形式书写的临床记录中隐藏的患者症状进行综合分析。先前的研究表明,借助人工智能(AI)技术(如自然语言处理(NLP)),该体系可实现信息化与智能化。然而,现有数据集在质量和数量上均不足以支撑数据驱动的 AI 技术在中医中的进一步发展。因此,本文聚焦于中医诊疗体系的核心任务——辨证(SD),并引入了首个公开的面向辨证的大规模数据集,称为 TCM-SD。我们的数据集包含 54,152 条真实世界临床记录,覆盖 148 种证候。此外,我们收集了中医领域的大规模无标注文本语料,并提出了一个领域特定的预训练语言模型,称为 ZY-BERT。我们使用深度神经网络进行实验,以建立强劲的性能基线,揭示辨证中的各类挑战,并证明领域特定预训练语言模型的潜力。我们的研究与分析揭示了融合计算机科学与语言学知识以探索中医理论经验有效性的机遇。

关键词

引用

@article{arxiv.2203.10839,
  title  = {TCM-SD: A Benchmark for Probing Syndrome Differentiation via Natural Language Processing},
  author = {Mucheng Ren and Heyan Huang and Yuxiang Zhou and Qianwen Cao and Yuan Bu and Yang Gao},
  journal= {arXiv preprint arXiv:2203.10839},
  year   = {2022}
}

备注

10 main pages + 2 reference pages, to appear at CCL2022