中文

小型波斯语医疗语言模型的推理能力提升可超越大规模数据训练

计算与语言 2026-01-07 v5

摘要

提升小型语言模型的推理能力对于医学问答等专业应用至关重要,尤其是对于像波斯语这样的边缘语言。本研究采用强化学习与AI反馈(RLAIF)和直接偏好优化(DPO)方法,提高通用波斯语语言模型的推理能力。为实现这一目标,我们将多选题医学问答数据集翻译成波斯语,并使用RLAIF生成被拒绝-偏好答案对,这些答案对是DPO训练所必需的。通过让教师模型和学生模型生成链式思考(CoT)推理响应,我们构建了一个包含正确与错误推理轨迹的数据集。该数据集包括200万token的偏好答案和250万token的被拒绝答案,用于训练基线模型,显著提升了其在波斯语中的医学推理能力。值得注意的是,最终得到的模型在性能上超过了其前身gaokerena-V模型,后者是在约5700万token的数据上训练的,尽管使用的数据量更小。这些结果突显了在数据稀缺的情况下,以推理为导向的训练方法在开发领域特定语言模型方面的效率和效果。

关键词

引用

@article{arxiv.2510.20059,
  title  = {Enhancing Reasoning Skills in Small Persian Medical Language Models Can Outperform Large-Scale Data Training},
  author = {Mehrdad Ghassabi and Sadra Hakim and Hamidreza Baradaran Kashani and Pedram Rostami},
  journal= {arXiv preprint arXiv:2510.20059},
  year   = {2026}
}

备注

7 pages, 5 figures