融合序列 Motif 与 Pan-基组特征:基于可解释轻量级 1D CNN-XGBoost 集成的抗药性预测
摘要
抗药性 (AMR) 是一场迅速恶化的全球性健康危机。尽管基因组测序使快速预测抗药表型成为可能,但当前计算方法存在局限性。标准机器学习模型将基因组视为无序特征集合,忽略了单核苷酸多态性 (SNP) 的序列上下文。状态机械化方法如 Transformer 往往数据需求量大且计算成本高,难以应用于本领域典型的中等规模数据集。为此,我们提出 AMR-EnsembleNet,一种融合序列学习和特征学习的集成框架。我们开发了一个轻量级自定义 1D 卷积神经网络 (CNN),高效学习来自高维 SNP 数据的可预测序列 Motif。该序列感知模型与 XGBoost 模型集成,后者擅长捕捉复杂非局部特征相互作用。我们在 809 株大肠杆菌基因型数据集上进行训练和评估,预测四种抗生素的抗药性。我们的 1D CNN-XGBoost 集成在所有抗生素上均实现了顶级性能,针对氟喹诺酮 (CIP) 的 Matthews 相关系数达到 0.926,针对困难的 Gentamicin (GEN) 抗药预测的最高宏平均 F1 分数为 0.691。我们还表明,该模型始终聚焦于已知抗药基因如 fusA 和 parC 内的 SNP,证明其学习了正确的抗药遗传信号。我们的工作表明,融合序列感知的 1D CNN 与基于特征的 XGBoost 模型形成的集成能够克服仅使用无序或独立序列模型的局限性。
引用
@article{arxiv.2509.23552,
title = {Fusing Sequence Motifs and Pan-Genomic Features: Antimicrobial Resistance Prediction using an Explainable Lightweight 1D CNN-XGBoost Ensemble},
author = {Md. Saiful Bari Siddiqui and Nowshin Tarannum},
journal= {arXiv preprint arXiv:2509.23552},
year = {2025}
}
备注
Submitted to SCA/HPCAsia 2026. This preprint version has been prepared for open-access distribution and may differ in formatting from the official proceedings. Also available on bioRxiv for visibility to the life sciences community