推荐系统中基于云协同数据增强与设备端学习的极致模型个性化
机器学习
2022-01-26 v1 人工智能
摘要
数据异构性是推荐系统的固有属性,使得在云上基于全局数据训练的模型(工业界主流方式)对每个用户本地数据分布并非最优。为应对数据异构性,利用设备端学习的模型个性化是一种潜在解决方案。然而,使用用户少量本地样本进行设备端训练会导致严重过拟合并削弱模型泛化能力。本工作中,我们提出一种名为 CoDA 的端云协同学习新框架,以打破纯云端学习与设备端学习的困境。CoDA 的核心原则是从云端的全局池中检索相似样本以增强每个用户的本地数据集来训练推荐模型。具体而言,在云端进行粗粒度样本匹配后,在每个设备上进一步训练个性化样本分类器以实现细粒度样本过滤,从而学习本地数据分布与外部数据分布之间的边界。我们还构建了端到端流水线以支持云与各设备间的数据、模型、计算与控制流。我们已将 CoDA 部署于手机淘宝的推荐场景中。在线 A/B 测试结果展示了 CoDA 相对于无模型个性化的云端学习及无数据增强的设备端训练的显著性能提升。在真实设备上的开销测试证明了 CoDA 中设备端任务的计算、存储与通信效率。
引用
@article{arxiv.2201.10382,
title = {On-Device Learning with Cloud-Coordinated Data Augmentation for Extreme Model Personalization in Recommender Systems},
author = {Renjie Gu and Chaoyue Niu and Yikai Yan and Fan Wu and Shaojie Tang and Rongfeng Jia and Chengfei Lyu and Guihai Chen},
journal= {arXiv preprint arXiv:2201.10382},
year = {2022}
}