面向人群水平病因分布的正则化贝叶斯迁移学习
统计方法学
2019-04-26 v2
摘要
计算机编码的口头尸检(CCVA)算法根据死者个体的高维家庭问卷数据(口头尸检)预测死因。CCVA 算法通常在非本地数据上训练,然后用于生成全国和地区特异性死亡比例估计。若非本地训练数据与感兴趣的本地人群不同,这些估计可能不准确。该问题是迁移学习的一个特例。然而,大多数迁移学习分类方法关注目标域(如特定人群)中个体(如某人)的分类,训练则在源域数据上进行。流行病学家通常更关注使用远小于常见迁移学习应用的数据集来估计人群水平的病因分布。我们提出一种简洁的分层贝叶斯迁移学习框架,直接估计目标域中的人群水平类别概率。为解决小样本量问题,我们引入一种针对迁移错误率的新颖收缩先验,保证在没有任何标记目标域数据或基线分类器迁移误差为零时,类别概率的校准估计与基线分类器的朴素估计一致,从而将默认做法作为特例纳入。一种使用数据增强的新颖 Gibbs 采样器实现了快速计算。我们将方法扩展为使用而非一个基线分类器的集成。理论与实证结果展示了集成模型如何偏好最准确的基线分类器。我们给出了允许类别概率随协变量变化的扩展,以及基于 EM 算法的 MAP 估计。开发了实现该方法的 R 包。
引用
@article{arxiv.1810.10572,
title = {Regularized Bayesian transfer learning for population level etiological distributions},
author = {Abhirup Datta and Jacob Fiksel and Agbessi Amouzou and Scott Zeger},
journal= {arXiv preprint arXiv:1810.10572},
year = {2019}
}