利用嵌入对抗冗余与模型退化
社会与信息网络
2018-09-21 v1 机器学习
机器学习
摘要
每天,数亿条包含 40 余种不断演变的方言用语的新推文流经 Twitter。试图从这一信息洪流中提取洞察的模型必须面对 Twitter 平台固有的剧烈协变量偏移。尽管定期重训练的算法能在这一偏移下保持性能,但未能表征新趋势与新词元的固定模型特征会迅速过时,导致性能退化。为缓解此问题,我们采用可高效表征数据分布最相关方面的学习特征,即嵌入模型。跨团队共享这些嵌入模型还可减少冗余,并成倍提升跨团队建模效率。本文详述了我们在 Twitter 已开发及正在开发的商品化工具、算法与流水线,用于定期生成高质量、最新的嵌入并在全公司广泛共享。
引用
@article{arxiv.1809.07703,
title = {Fighting Redundancy and Model Decay with Embeddings},
author = {Dan Shiebler and Luca Belli and Jay Baxter and Hanchen Xiong and Abhishek Tayal},
journal= {arXiv preprint arXiv:1809.07703},
year = {2018}
}
备注
Presented at the Common Model Infrastructure Workshop at KDD 2018 (link: https://cmi2018.sdsc.edu/)