反思预训练实现生物序列模型中的词元级自我校正
计算与语言
2025-12-25 v1 人工智能
摘要
思维链(Chain-of-Thought, CoT)提示显著提升了大型语言模型在自然语言处理中的任务解决能力。与标准提示不同,CoT 鼓励模型生成中间推理步骤(非答案词元),这些步骤有助于引导模型得出更准确的最终输出。这些中间步骤使更复杂的推理过程成为可能,例如错误纠正、记忆管理、未来规划和自我反思。然而,将 CoT 应用于非自然语言领域(如蛋白质和 RNA 语言模型)目前尚不可行,主要原因是其词元空间(例如氨基酸词元)的表达能力有限。在这项工作中,我们提出并定义了语言表达能力的概念:一种给定语言利用其词元和语法编码信息的能力。我们证明,蛋白质语言有限的表达能力严重限制了 CoT 式推理的适用性。为克服这一限制,我们首次在生物序列模型中引入了反思预训练,使模型能够通过生成超越简单答案词元的辅助“思考词元”来进行中间推理。理论上,我们证明增强后的词元集显著提升了生物语言的表达能力,从而提高了模型的整体推理能力。实验上,我们的预训练方法教会蛋白质模型进行自我校正,并相较于标准预训练带来了显著的性能提升。
引用
@article{arxiv.2512.20954,
title = {Reflection Pretraining Enables Token-Level Self-Correction in Biological Sequence Models},
author = {Xiang Zhang and Jiaqi Wei and Yuejin Yang and Zijie Qiu and Yuhan Chen and Zhiqiang Gao and Muhammad Abdul-Mageed and Laks V. S. Lakshmanan and Wanli Ouyang and Chenyu You and Siqi Sun},
journal= {arXiv preprint arXiv:2512.20954},
year = {2025}
}