中文

MiST:理解中期科学训练在发展化学推理模型中的作用

机器学习 2026-01-27 v3 材料科学

摘要

大型语言模型可通过基于规则的奖励进行在线微调以发展推理能力。然而,近期研究揭示了一个关键约束:强化学习仅在基础模型已对正确答案分配非忽略概率时才会成功——即我们称之为‘潜在可解性’的属性。本 work 探讨了化学推理能力的出现以及这些先决条件对化学的意义。我们识别出基于 RL 的化学推理的两个必要条件:1)符号能力,2)潜在化学知识。我们提出中期科学训练(MiST):一组满足这些条件的中期训练技术,包括采用 SMILES/CIF 感知预处理的数据混合、使用 29 亿标记继续预训练,以及使用 10 亿标记的监督式微调。这些步骤将 3B 和 7B 模型的潜在可解性得分提升最高可达 1.8 倍,使在有机反应命名和无机材料生成上的 top-1 准确率分别从 10.9% 提升至 63.9% 和从 40.6% 提升至 67.4%。其他具有挑战性的化学任务也取得了类似结果,同时产生可解释的推理痕迹。我们的结果界定了化学推理训练的明确先决条件,凸显了中期训练在解锁推理能力中的更广泛作用。

关键词

引用

@article{arxiv.2512.21231,
  title  = {MiST: Understanding the Role of Mid-Stage Scientific Training in Developing Chemical Reasoning Models},
  author = {Andres M Bran and Tong Xie and Shai Pranesh and Jeffrey Meng and Xuan Vu Nguyen and Jeremy Goumaz and David Ming Segura and Ruizhi Xu and Dongzhan Zhou and Wenjie Zhang and Bram Hoex and Philippe Schwaller},
  journal= {arXiv preprint arXiv:2512.21231},
  year   = {2026}
}