对抗正则化混合效应深度学习(ARMED)模型:用于聚类数据上可解释性、性能与泛化的提升
机器学习
2022-05-02 v3 机器学习
摘要
自然科学数据集经常违背独立性假设。样本可能是聚类的(例如按研究地点、受试者或实验批次),导致虚假关联、模型拟合不佳与混杂分析。尽管深度学习领域很大程度上未解决此问题,统计学界已通过混合效应模型处理,其将聚类不变的固定效应与聚类特定的随机效应分离。我们提出一种通用框架,通过对现有神经网络的非侵入式添加实现对抗正则化混合效应深度学习(ARMED)模型:1)一个对抗分类器约束原模型仅学习聚类不变特征;2)一个捕捉聚类特定特征的随机效应子网络;3)一种将随机效应应用于训练期间未见过聚类的方法。我们将 ARMED 应用于密集网络、卷积网络与自编码器神经网络,涵盖 4 项应用,包括模拟非线性数据、痴呆预后与诊断以及活细胞图像分析。与先前技术相比,ARMED 模型在模拟中更好区分混杂关联与真实关联,并在临床应用中学到更具生物学合理性的特征。它们还能量化聚类间方差并可视化数据中的聚类效应。最后,ARMED 在来自训练所见聚类的数据上提升准确率(较常规模型最高达 28%),并改善对未见聚类的泛化(较常规模型最高达 9%)。
引用
@article{arxiv.2202.11783,
title = {Adversarially-regularized mixed effects deep learning (ARMED) models for improved interpretability, performance, and generalization on clustered data},
author = {Kevin P. Nguyen and Albert Montillo},
journal= {arXiv preprint arXiv:2202.11783},
year = {2022}
}
备注
Added comparisons to other mixed effects methods. 13 pages, 6 figures, 5 tables