学习大规模通用用户表示:基于稀疏专家混合的方法
机器学习
2022-07-12 v1 计算与语言
摘要
由于随时间演化的复杂特征交互以及用户特征的高维性,学习用户序列行为嵌入非常复杂且具挑战性。近期涌现的基础模型(如BERT及其变体)激励了众多研究者在该领域探索。然而,不同于自然语言处理(NLP)任务,用户行为模型的参数主要来自用户嵌入层,这使得多数现有工作难以训练大规模的通用用户嵌入。此外,用户表示从多个下游任务中学习,以往研究未解决跷跷板现象。本文提出SUPERMOE,一种从多任务获取高质量用户表示的通用框架。具体地,用户行为序列由MoE transformer编码,从而可将模型容量提升至数十亿参数乃至数万亿参数。为处理跨多任务学习时的跷跷板现象,我们设计了一种带任务指示符的新损失函数。我们在公开数据集上进行了广泛的离线实验,并在私有真实业务场景中进行了在线实验。我们的方法优于SOTA模型,结果证明了框架的有效性。
引用
@article{arxiv.2207.04648,
title = {Learning Large-scale Universal User Representation with Sparse Mixture of Experts},
author = {Caigao Jiang and Siqiao Xue and James Zhang and Lingyue Liu and Zhibo Zhu and Hongyan Hao},
journal= {arXiv preprint arXiv:2207.04648},
year = {2022}
}
备注
Accepted by ICML 2022 Pre-training Workshop