中文

强化学习提升疾病分类中大语言模型的准确性与推理能力

人工智能 2026-04-22 v1

摘要

从放射科报告中准确分类疾病对于许多应用至关重要。虽然对轻量级大语言模型进行监督微调 (SFT) 可提高准确性,但可能降低推理能力。我们提出一种两阶段方法:对疾病标签进行 SFT,然后通过群体相对策略优化 (Group Relative Policy Optimization, GRPO) 进行细化,通过优化准确性和格式而无需推理监督来提升预测效果。在三个由放射科医生标注的数据集上,SFT 优于基线方法,GRPO 进一步提高了分类准确性,并增强了推理召回率和全面性。

关键词

引用

@article{arxiv.2604.19060,
  title  = {Reinforcement Learning Improves LLM Accuracy and Reasoning in Disease Classification from Radiology Reports},
  author = {Yishu Wei and Yi Lin and Adam Flanders and George Shih and Yifan Peng},
  journal= {arXiv preprint arXiv:2604.19060},
  year   = {2026}
}