中文

用于生物序列模型的 SHAP zero 解释,在近似零的边际成本下查询

机器学习 2025-05-23 v4 计算工程、金融与科学 基因组学 统计计算

摘要

随着机器学习模型在生物序列中的应用日益增长,解释性预测的需求日益增长,Shapley 值已成为模型解释的理论基础标准。虽然对单个输入序列具有局部解释效果,但将基于 Shapley 的解释性扩展以提取全局生物学见解需要评估数千个序列——这会导致每个查询的指数级计算成本。我们引入 SHAP zero—a一种新型算法,通过在大规模生物数据集上对 Shapley 值计算进行摊销。经过一次模型草图步骤后,SHAP zero 即可实现查询的近似零边际成本,通过揭示 Shapley 值、高阶特征交互作用以及模型的稀疏傅里叶变换之间的潜在联系。应用于 guide RNA 有效性、DNA 修复结果和蛋白质适应性模型时,SHAP zero 比现有方法快一个数量级,恢复了此前无法在规模上获取的丰富的组合交互作用。这一工作为生物序列模型的原则性、高效和可扩展解释性打开了大门。

关键词

引用

@article{arxiv.2410.19236,
  title  = {SHAP zero Explains Biological Sequence Models with Near-zero Marginal Cost for Future Queries},
  author = {Darin Tsui and Aryan Musharaf and Yigit Efe Erginbas and Justin Singh Kang and Amirali Aghazadeh},
  journal= {arXiv preprint arXiv:2410.19236},
  year   = {2025}
}