中文

ShizhenGPT:面向中医的多模态大语言模型探索

计算与语言 2025-08-21 v1 人工智能 计算机视觉与模式识别 机器学习 多媒体

摘要

尽管大语言模型(LLMs)在诸多领域取得了成功,但其在中医(TCM)领域的潜力仍因两大关键障碍而远未被充分挖掘:(1)高质量中医数据的稀缺,以及(2)中医诊断固有的多模态特性,即望、闻、问、切。这些感官丰富的模态超出了传统大语言模型的能力范围。为应对这些挑战,我们提出了 ShizhenGPT,这是首个为中医量身定制的多模态大语言模型。为克服数据稀缺问题,我们整理了迄今为止最大的中医数据集,包含超过 100GB 的文本和超过 200GB 的多模态数据,涵盖 120 万张图像、200 小时音频及生理信号。ShizhenGPT 经过预训练和指令微调,以获得深厚的中医知识和多模态推理能力。在评估方面,我们收集了近年的全国中医资格考试试题,并构建了一个用于药材识别与视觉诊断的视觉基准。实验表明,ShizhenGPT 优于同等规模的大语言模型,并能与更大的闭源模型相媲美。此外,它在现有多模态大语言模型的中医视觉理解方面处于领先地位,并展现出跨声音、脉象、气味和视觉等模态的统一感知能力,为中医实现整体多模态感知与诊断铺平了道路。数据集、模型和代码均已公开。我们希望这项工作能激发该领域的进一步探索。

关键词

引用

@article{arxiv.2508.14706,
  title  = {ShizhenGPT: Towards Multimodal LLMs for Traditional Chinese Medicine},
  author = {Junying Chen and Zhenyang Cai and Zhiheng Liu and Yunjin Yang and Rongsheng Wang and Qingying Xiao and Xiangyi Feng and Zhan Su and Jing Guo and Xiang Wan and Guangjun Yu and Haizhou Li and Benyou Wang},
  journal= {arXiv preprint arXiv:2508.14706},
  year   = {2025}
}