中文

构建中文医疗对话系统:整合大规模语料库与新型模型

计算与语言 2025-02-26 v2 人工智能 机器学习

摘要

全球新冠肺炎疫情凸显了传统医疗系统的重大缺陷,加速了线上医疗服务的发展,尤其是在医疗分诊和咨询方面。然而,现有研究面临两个主要挑战:首先,由于隐私原因,缺乏大规模、公开可用的领域特定医疗数据集,现有数据集规模小且仅限于少数疾病,限制了基于预训练语言模型(PLMs)的分诊方法的有效性;其次,现有方法缺乏医学知识,难以准确理解患者-医生咨询中的专业术语和表达。为克服这些障碍,我们构建了大规模中文医疗对话语料库(LCMDC),从而解决了该领域的数据不足问题。此外,我们进一步提出一种新型分诊系统,将BERT-based监督学习与提示学习相结合,以及一种基于GPT的医疗咨询模型。为增强领域知识获取,我们使用自构建的背景语料对PLMs进行预训练。在LCMDC上的实验结果表明,我们提出的方法具有有效性。

关键词

引用

@article{arxiv.2410.03521,
  title  = {Building a Chinese Medical Dialogue System: Integrating Large-scale Corpora and Novel Models},
  author = {Xinyuan Wang and Haozhou Li and Dingfang Zheng and Qinke Peng},
  journal= {arXiv preprint arXiv:2410.03521},
  year   = {2025}
}