机器学习在药物基因组学中的应用:血浆浓度-时间曲线聚类
应用统计
2024-06-26 v2 机器学习
摘要
药物研究人员不断寻找可改善药物开发流程与患者结局的技术。近期备受关注的一个方向是机器学习(ML)在药理学中的应用潜力。其中一个尚未被深入研究的此类应用是对血浆浓度-时间曲线(以下称药代动力学(PK)曲线)的无监督聚类。本文中,我们展示了关于如何依据相似性对 PK 曲线进行聚类的发现。具体而言,我们发现聚类能有效识别形状相似的 PK 曲线,并有助于理解各 PK 曲线簇内的模式。由于 PK 曲线属于时间序列数据对象,我们的方法以大量关于时间序列数据聚类的研究为起点。据此,我们考察了多种时间序列数据对象间的不相似度度量,以找出最适用于 PK 曲线的那些。我们确定欧氏距离(Euclidean distance)通常最适于 PK 曲线聚类,并进一步表明动态时间规整(dynamic time warping)、Fréchet 距离以及基于结构的不相似度量(如相关性)可能产生意外结果。作为示例,我们在一个先前药物基因组学研究使用的 250 条 PK 曲线的案例研究中应用了这些方法。我们的案例研究发现,仅采用欧氏距离的无监督 ML 聚类,在没有任何受试者遗传信息的情况下,能够独立验证与参考药物基因组学结果相同的结论。据我们所知,这是首个此类证明。此外,该案例研究展示了 PK 曲线聚类如何产生仅凭 PK 指标的群体水平汇总统计难以察觉的洞见。
引用
@article{arxiv.2210.13310,
title = {Applications of Machine Learning in Pharmacogenomics: Clustering Plasma Concentration-Time Curves},
author = {Jackson P. Lautier and Stella Grosser and Jessica Kim and Hyewon Kim and Junghi Kim},
journal= {arXiv preprint arXiv:2210.13310},
year = {2024}
}
备注
38 pages, 14 figures, 3 tables