中文

利用组相对策略优化推进中医药大语言模型

计算与语言 2025-10-21 v1 人工智能 机器学习

摘要

中医药 (TCM) 具备丰富且结构独特的知识体系,挑战了大语言模型 (LLM) 的常规应用。尽管以往针对中医药的 LLM 通过监督式微调取得了进展,但它们常面临对齐性、数据质量和评估一致性方面的局限。本研究引入了 Ladder-base,这是首个采用组相对策略优化 (GRPO) 训练的 TCM 专注型 LLM。GRPO 是一种强化学习方法,通过基于组内比较优化响应选择来提高推理能力和事实一致性。Ladder-base 基于 Qwen2.5-7B-Instruct 基础模型构建,仅使用 TCM-Ladder 数据集的文本子集进行训练,训练集占数据的 80%,剩余 20% 数据在验证和测试集之间平均分割。通过标准化评估,Ladder-base 在多个推理指标上均优于包括 GPT-4、Gemini 2.5、Claude 3 和 Qwen3 在内的领先通用 LLM,以及包括 BenTsao、HuatuoGPT2 和 Zhongjing 在内的领域特定中医药模型。这些发现表明,GRPO 为在中医药等专业医学领域对齐 LLM 提供了有效且高效的策略,支持开发可信且临床依据的中医药人工智能系统。

关键词

引用

@article{arxiv.2510.17402,
  title  = {Leveraging Group Relative Policy Optimization to Advance Large Language Models in Traditional Chinese Medicine},
  author = {Jiacheng Xie and Shuai Zeng and Yang Yu and Xiaoting Tang and Guanghui An and Dong Xu},
  journal= {arXiv preprint arXiv:2510.17402},
  year   = {2025}
}