面向快手的多任务学习的层次化多门专家系统(HoME)
信息检索
2024-08-13 v1 机器学习
摘要
本文介绍了来自短视频服务的实际问题及所学经验。在行业中,混合专家(MoE)范式是广泛使用的数据多任务框架,该范式为每个任务引入一些共享和特定专家,然后使用门网络来衡量相关专家的贡献。尽管MoE取得了显著的改进,但我们仍观察到三种异常现象严重影响模型性能:(1)专家崩溃:我们发现专家的输出分布差异很大,一些专家有超过90%的零激活,导致门网络难以为平衡专家分配公平权重。(2)专家退化:理想情况下,共享专家旨在为所有任务同时提供预测信息。然而,我们发现一些共享专家被单个任务占用,这表明共享专家失去了能力,退化为某些特定专家。(3)专家欠拟合:在我们的服务中,我们需要预测数十种行为任务,但发现一些数据稀疏的预测任务倾向于忽略其特定专家并为共享专家分配大权重。可能的原因是共享专家能够从稠密任务中感知更多的梯度更新和知识,而特定专家容易因其稀疏行为而陷入欠拟合。鉴于这些观察,我们提出HoME,以实现一种简单、高效且平衡的MoE系统,用于多任务学习。
引用
@article{arxiv.2408.05430,
title = {HoME: Hierarchy of Multi-Gate Experts for Multi-Task Learning at Kuaishou},
author = {Xu Wang and Jiangxia Cao and Zhiyi Fu and Kun Gai and Guorui Zhou},
journal= {arXiv preprint arXiv:2408.05430},
year = {2024}
}
备注
Work in progress