中文

RDPD:通过模仿以富数据助贫数据

机器学习 2019-08-27 v4 机器学习

摘要

在许多情况下,我们需要在具有不同数据质量的相关环境中构建并部署独立的模型。例如,具备强观测设备(如重症监护室)的环境通常提供高质量多模态数据,这些数据来自多个传感设备并具有丰富特征表示。另一方面,观测设备简陋(如家庭)的环境仅提供低质量、单模态且特征表示贫乏的数据。为了在不直接访问富数据环境获取的多模态数据的情况下,在贫数据环境中部署具有竞争力的模型,本文开发并提出了一种知识蒸馏(KD)方法(RDPD),利用从在丰富私有数据上训练的高复杂度模型蒸馏出的知识,增强在贫数据上训练的预测模型。我们在三个真实世界数据集上评估了 RDPD,结果表明其蒸馏模型在所有数据集上一致优于所有基线,尤其在 PR-AUC 上比仅基于低质量数据训练的模型提升 24.56%、在 ROC-AUC 上提升 12.21%,比最先进 KD 模型在 PR-AUC 上提升 5.91%、在 ROC-AUC 上提升 4.44%。

关键词

引用

@article{arxiv.1809.01921,
  title  = {RDPD: Rich Data Helps Poor Data via Imitation},
  author = {Shenda Hong and Cao Xiao and Trong Nghia Hoang and Tengfei Ma and Hongyan Li and Jimeng Sun},
  journal= {arXiv preprint arXiv:1809.01921},
  year   = {2019}
}

备注

Published in IJCAI 2019