中文

REM-CTX:基于强化学习与辅助上下文的自动同行评审

计算与语言 2026-04-02 v1 人工智能

摘要

大多数自动同行评审系统仅依赖文本稿件内容,导致视觉元素如图表和外部学术信号未被充分利用。我们提出REM-CTX,一个通过与上下文相关的奖励函数将辅助上下文融入评审生成过程的强化学习系统。REM-CTX使用组相对策略优化(GRPO)训练一个8B参数语言模型,并结合多维度质量奖励与两个明确鼓励与辅助上下文对齐的与上下文相关的奖励。在涵盖计算机科学、生物科学和物理科学的稿件实验中,REM-CTX在六种基线中取得了最高的整体评审质量,优于其他使用规模大得多的商业模型的系统,并在质量和上下文锚定两个指标上超越了次优的强化学习基线。消融研究证实这两个与上下文相关的奖励是互补的:每个奖励选择性地改善其对应的与上下文相关的奖励,同时保持所有质量维度,且完整模型优于所有部分变体。训练动态分析表明,批评维度在训练过程中与其他指标呈负相关,这提示未来研究应将多维度奖励进行分组以用于评审生成。

关键词

引用

@article{arxiv.2604.00248,
  title  = {REM-CTX: Automated Peer Review via Reinforcement Learning with Auxiliary Context},
  author = {Pawin Taechoyotin and Daniel E. Acuna},
  journal= {arXiv preprint arXiv:2604.00248},
  year   = {2026}
}

备注

12 pages, 6 figures