中文

PepThink-R1:面向可解释环状肽优化的LLM框架,结合思维链SFT与强化学习

机器学习 2026-03-30 v3 人工智能

摘要

设计具有定制特性的治疗性肽受到序列空间庞大、实验数据有限以及当前生成模型可解释性差的阻碍。为应对这些挑战,我们引入了PepThink-R1,一个将大语言模型(LLMs)与思维链(CoT)监督微调和强化学习(RL)相结合的生成框架。与先前方法不同,PepThink-R1在序列生成过程中明确推理单体级别的修改,使设计选择具有可解释性,同时优化多种药理性质。在平衡化学有效性和性质改进的定制奖励函数指导下,该模型自主探索多样化的序列变体。我们证明PepThink-R1生成的环状肽在亲脂性、稳定性和暴露度方面显著增强,在优化成功率和可解释性方面均优于现有通用LLM(如GPT-5)和领域特定基线。据我们所知,这是第一个将显式推理与RL驱动的性质控制相结合的基于LLM的肽设计框架,标志着面向治疗发现的可靠且透明的肽优化迈出了一步。

关键词

引用

@article{arxiv.2508.14765,
  title  = {PepThink-R1: LLM for Interpretable Cyclic Peptide Optimization with CoT SFT and Reinforcement Learning},
  author = {Ruheng Wang and Hang Zhang and Trieu Nguyen and Shasha Feng and Hao-Wei Pang and Xiang Yu and Li Xiao and Peter Zhiping Zhang},
  journal= {arXiv preprint arXiv:2508.14765},
  year   = {2026}
}

备注

39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: AI for Science (Spotlight)