中文

Huatuo-26M:大规模中文医疗问答数据集

计算与语言 2023-05-03 v1 人工智能

摘要

本文发布了一个迄今最大的医疗问答(QA)数据集,包含 2600 万 QA 对。我们在该数据集上从检索与生成两方面对许多现有方法进行基准测试。实验结果表明,现有模型表现远低于预期,所发布数据集在预训练语言模型时代仍具挑战性。此外,我们还通过实验展示了该数据集多方面的益处:(i)以零样本方式训练用于其他 QA 数据集的模型;(ii)作为检索增强生成(RAG)的外部知识;(iii)通过将 QA 对作为持续训练中的预训练语料来改进现有预训练语言模型。我们相信该数据集不仅有助于医学研究,也将便利患者与临床医生。见 \url{https://github.com/FreedomIntelligence/Huatuo-26M}。

关键词

引用

@article{arxiv.2305.01526,
  title  = {Huatuo-26M, a Large-scale Chinese Medical QA Dataset},
  author = {Jianquan Li and Xidong Wang and Xiangbo Wu and Zhiyi Zhang and Xiaolong Xu and Jie Fu and Prayag Tiwari and Xiang Wan and Benyou Wang},
  journal= {arXiv preprint arXiv:2305.01526},
  year   = {2023}
}