超越路径选择:基于 MimicSFT 与 Relevance and Rule-induced(R$^2$)GRPO 的更优科学信息抽取 LLM
计算与语言
2025-05-29 v1 人工智能
信息检索
摘要
先前的研究表明,使用可验证奖励强化学习(RLVR)训练的强大大型语言模型(LLM)在数学任务中仅精炼推理路径而不提升推理能力,而基于蒸馏的监督微调(SFT)则可以提升。我们从科学信息抽取(SciIE)的角度对此进行研究,在该任务中 LLM 和推理 LLM 的表现不如基于 Bert 的小型模型。SciIE 既需要推理也需要记忆。我们论证了基于 SciIE,SFT 和 RLVR 都能以简单的方式精炼推理路径并提升推理能力。我们提出了两阶段训练:1. MimicSFT,使用结构化推理模板,无需高质量的思维链数据;2. RGRPO,具有相关性和规则诱导奖励。在科学 IE 基准上的实验表明,这两种方法都能提升推理能力。结合 mimicSFT 的 RGRPO 在关系抽取中超越了基线 LLM 和专门的监督模型。我们的代码可在 https://github.com/ranlislz/R2GRPO 获取。
引用
@article{arxiv.2505.22068,
title = {Beyond path selection: Better LLMs for Scientific Information Extraction with MimicSFT and Relevance and Rule-induced(R$^2$)GRPO},
author = {Ran Li and Shimin Di and Yuchen Liu and Chen Jing and Yu Qiu and Lei Chen},
journal= {arXiv preprint arXiv:2505.22068},
year = {2025}
}