从新视角看可解释性:面向生物医学应用的分层与领域知识融合
机器学习
2023-03-17 v1 人机交互
定量方法
摘要
机器学习(ML)技术在生物医学领域的应用日益重要,尤其在 COVID-19 大流行后所产生的大量数据背景下。然而,由于生物医学数据集的复杂性以及黑盒 ML 模型的使用,可能引发领域专家缺乏信任与采用的问题。对此,可解释机器学习(IML)方法已被开发,但生物医学数据集中的维数灾难会导致模型不稳定。本文提出一种新颖的计算策略,将生物医学问题数据集分层为 k 折交叉验证(CVs),并将领域知识解释技术嵌入当前最先进的 IML 框架中。该方法可提升模型稳定性、建立信任,并为训练所得 IML 模型产生的结果提供解释。具体而言,模型输出(如聚合特征权重重要性)可通过通路功能富集、药物靶向与重定位数据库等技术进一步关联至领域知识解释。此外,在 IML 框架选择前后让终端用户与临床医生参与焦点小组讨论,有助于引导可检验假设、改善性能指标,并在生物医学领域构建可信且可用的 IML 解决方案。总体而言,本研究凸显了将先进计算技术与领域知识解释相结合,以提升复杂生物医学数据集背景下 IML 解决方案有效性的潜力。
引用
@article{arxiv.2303.09322,
title = {Interpretability from a new lens: Integrating Stratification and Domain knowledge for Biomedical Applications},
author = {Anthony Onoja and Francesco Raimondi},
journal= {arXiv preprint arXiv:2303.09322},
year = {2023}
}
备注
10 pages concept paper