ODBAE:一种在高维生物数据集中识别复杂表型的高性能模型
机器学习
2024-10-24 v2 机器学习
摘要
由于不同生理指标之间复杂的相互依赖关系,从高维生物数据中识别复杂表型具有挑战性。传统方法通常侧重于检测单变量中的离群值,忽略了促成表型出现的更广泛相互作用网络。在此,我们介绍 ODBAE(使用平衡自编码器的离群值检测),一种机器学习方法,旨在通过捕捉多个生理参数之间的潜在关系来揭示细微和极端的离群值。ODBAE 修订的损失函数增强了其检测两类关键离群值的能力:影响点(IP),即破坏维度间潜在相关性者;高杠杆点(HLP),即偏离常态但传统基于自编码器的方法无法检测者。利用国际小鼠表型联盟(IMPC)的数据,我们表明 ODBAE 能够识别具有复杂多指标表型的敲除小鼠——单个性状正常,但综合考量时异常。此外,该方法揭示了新的代谢相关基因,并发现了代谢指标间协调的异常。我们的结果凸显了 ODBAE 在检测联合异常和推进我们对生物系统稳态扰动理解方面的效用。
引用
@article{arxiv.2211.03054,
title = {ODBAE: a high-performance model identifying complex phenotypes in high-dimensional biological datasets},
author = {Yafei Shen and Tao Zhang and Zhiwei Liu and Kalliopi Kostelidou and Ying Xu and Ling Yang},
journal= {arXiv preprint arXiv:2211.03054},
year = {2024}
}