通过蒸馏降低预测变动
机器学习
2022-03-15 v2 人工智能
机器学习
摘要
在实际系统中,模型会随着更多数据的出现而频繁更新,除了实现高准确率外,目标还包括与基模型相比保持较低的预测差异(即预测“变动”,predictive churn)。如果模型重训练导致行为大不相同,则可能对下游系统产生负面影响,尤其是当这种变动可以在对模型准确率影响有限的情况下被避免时。在本文中,我们展示了以基模型为教师进行蒸馏训练与对预测变动施加显式约束的训练之间的等价性。随后我们表明,在广泛的数据集和模型架构(包括全连接网络、卷积网络和 transformers)上,相较于若干近期基线方法,蒸馏在低变动训练中表现强劲。
引用
@article{arxiv.2106.02654,
title = {Churn Reduction via Distillation},
author = {Heinrich Jiang and Harikrishna Narasimhan and Dara Bahri and Andrew Cotter and Afshin Rostamizadeh},
journal= {arXiv preprint arXiv:2106.02654},
year = {2022}
}