中文

Mamba-SSM 结合 LLM 推理进行特征选择:忠诚度感知的生物标志物发现

定量方法 2026-04-20 v2 人工智能

摘要

来自深度序列模型的梯度灵敏度可高效地表面候选生物标志物,但所得基因列表可能受组织组成混合因子污染,导致下游分类器性能下降。我们研究了 LLM 链条推理(CoT)是否可过滤这些混合因子,以及推理质量是否与下游性能相关。我们在 TCGA-BRCA RNA-seq 上训练 Mamba SSM,并提取梯度灵敏度排名前 50 的基因;DeepSeek-R1 对每个候选者进行结构化 CoT 评估,以产生最终的 17 基因集合。在保留测试集上,原始 50 基因灵敏度集合(无 LLM)的表现不如 5,000 基因方差基线(AUC 0.832 vs. 0.903),而 LLM 过滤后的集合超过后者(AUC 0.927),使用 294 倍更少的特征。忠诚度审计(COSMIC CGC、OncoKB、PAM50)显示,6 个 17 个选中基因中(35.3%)为已验证 BRCA 生物标志物,而 10 个 16 个已知 BRCA 基因在输入中未被选中——包括 FOXA1。这种下游性能与推理忠诚度之间的差异表明本环境中存在选择性忠诚度:针对性混合因子移除可提升预测性能,而无需全面召回。

关键词

引用

@article{arxiv.2604.14334,
  title  = {Mamba-SSM with LLM Reasoning for Feature Selection: Faithfulness-Aware Biomarker Discovery},
  author = {Pushpa Kumar Balan and Aijing Feng},
  journal= {arXiv preprint arXiv:2604.14334},
  year   = {2026}
}

备注

9 pages, 4 figures. Accepted at ICLR 2026 Workshop on Logical Reasoning of Large Language Models