基于符号回归的微生物组相对丰度数据解释
机器学习
2024-10-22 v1 定量方法
摘要
理解微生物组内复杂相互作用对于开发有效的诊断和治疗策略至关重要。传统机器学习模型往往缺乏可解释性,这对于临床和生物学意义至关重要。本文探索了将符号回归(SR)应用于微生物组相对丰度数据的方法,特别关注结肠癌(CRC)。SR因其高可解释性与传统机器学习模型(如随机森林、梯度提升决策树)进行比较。我们利用71个研究,涵盖多个队列,超过10,000个样本,涉及749种物种特征。我们的结果表明,SR不仅在预测性能方面与之竞争,更在模型可解释性方面表现出色。SR提供显式的数学表达式,为微生物组内生物学关系提供洞见,这对于临床和生物学解释具有重要优势。我们的实验还显示,SR可帮助理解复杂模型如XGBoost,通过知识蒸馏。为促进可重复性和进一步研究,我们已在https://github.com/swag2198/microbiome-symbolic-regression 上公开代码。
引用
@article{arxiv.2410.16109,
title = {Interpreting Microbiome Relative Abundance Data Using Symbolic Regression},
author = {Swagatam Haldar and Christoph Stein-Thoeringer and Vadim Borisov},
journal= {arXiv preprint arXiv:2410.16109},
year = {2024}
}
备注
5 pages, 2 figures