中文

Cell-o1:利用强化学习训练大语言模型求解单细胞推理谜题

计算与语言 2025-06-04 v1 人工智能 计算工程、金融与科学 人机交互 机器学习

摘要

细胞类型注释是分析单细胞 RNA 测序数据异质性的关键任务。尽管近期的基础模型可以自动化这一过程,但它们通常独立地注释细胞,不考虑批次级细胞上下文,也不提供解释性推理。相比之下,人类专家通常基于领域知识为不同细胞簇注释不同的细胞类型。为模仿这一工作流程,我们引入了 CellPuzzles 任务,其目标是为一批细胞分配唯一的细胞类型。该基准涵盖多种组织、疾病和供体条件,并需要跨批次级细胞上下文进行推理以确保标签的唯一性。我们发现现成的大语言模型(LLM)在 CellPuzzles 上表现不佳,最好的基线模型(OpenAI 的 o1)仅达到 19.0% 的批次级准确率。为弥补这一差距,我们提出了 Cell-o1,一个 7B 的大语言模型,通过在蒸馏推理轨迹上的监督微调进行训练,随后利用批次级奖励进行强化学习。Cell-o1 达到了最先进的性能,比 o1 提升了超过 73%,并且在不同上下文中具有良好的泛化能力。对训练动态和推理行为的进一步分析为批次级注释性能和涌现的专家级推理提供了见解。代码和数据可在 https://github.com/ncbi-nlp/cell-o1 获取。

关键词

引用

@article{arxiv.2506.02911,
  title  = {Cell-o1: Training LLMs to Solve Single-Cell Reasoning Puzzles with Reinforcement Learning},
  author = {Yin Fang and Qiao Jin and Guangzhi Xiong and Bowen Jin and Xianrui Zhong and Siru Ouyang and Aidong Zhang and Jiawei Han and Zhiyong Lu},
  journal= {arXiv preprint arXiv:2506.02911},
  year   = {2025}
}

备注

28 pages; 16 tables; 7 figures; Code: https://github.com/ncbi-nlp/cell-o1