中文

用于 LLM 分布外推理的强化学习:基于诊断相关组编码的实证研究

机器学习 2025-10-16 v2 人工智能

摘要

诊断相关组(DRG)代码对医院报销和运营至关重要,但其分配过程耗费大量人力。由于任务的分布外(OOD)特性,大型语言模型(LLM)在 DRG 编码上表现挣扎:预训练语料库极少包含私有的临床或计费数据。我们引入了 DRG-Sapphire,它利用大规模强化学习(RL)从临床笔记中自动进行 DRG 编码。DRG-Sapphire 基于 Qwen2.5-7B 构建,并使用基于规则的奖励进行群组相对策略优化(GRPO)训练,引入了一系列 RL 增强方法,以应对先前数学任务中未见的领域特定挑战。我们的模型在 MIMIC-IV 基准上实现了 SOTA 的准确率,并为 DRG 分配生成了经医生验证的推理,显著增强了可解释性。我们的研究进一步揭示了将 RL 应用于知识密集型 OOD 任务的更广泛挑战。我们观察到,RL 性能与监督微调(SFT)样本数的对数近似呈线性关系,这表明 RL 的有效性从根本上受限于基础模型中编码的领域知识。对于如 DRG 编码的 OOD 任务,强大的 RL 性能要求在 RL 之前进行充分的知识注入。因此,在此类任务中,扩展 SFT 可能比仅扩展 RL 更有效且计算效率更高。

关键词

引用

@article{arxiv.2505.21908,
  title  = {Reinforcement Learning for Out-of-Distribution Reasoning in LLMs: An Empirical Study on Diagnosis-Related Group Coding},
  author = {Hanyin Wang and Zhenbang Wu and Gururaj Kolar and Hariprasad Korsapati and Brian Bartlett and Bryan Hull and Jimeng Sun},
  journal= {arXiv preprint arXiv:2505.21908},
  year   = {2025}
}