在深度混合专家模型中学习因子化表示
机器学习
2014-03-11 v3
摘要
混合专家 (Mixture of Experts) 模型结合了多个“专家”网络的输出,每个专家专门处理输入空间的不同部分。这是通过训练一个“门控”网络来实现的,该网络将每个输入映射到专家上的分布。此类模型在构建更大规模网络方面展现出前景,这些网络在测试时计算成本低廉,且在训练时更具并行性。在这项工作中,我们将混合专家模型扩展为堆叠模型,即深度混合专家 (Deep Mixture of Experts),具有多层门控和专家组合。通过将每个输入与各层的专家组合相关联,这种方法指数级地增加了有效专家的数量,同时保持了适度的模型规模。在随机平移版本的 MNIST 数据集上,我们发现深度混合专家模型自动学习在第一层发展出位置依赖型(“在哪里”)专家,在第二层发展出类别特定型(“是什么”)专家。此外,我们观察到当模型应用于语音单音素数据集时,不同的组合得到了有效利用。这些结果表明所有专家组合均得到了有效使用。
引用
@article{arxiv.1312.4314,
title = {Learning Factored Representations in a Deep Mixture of Experts},
author = {David Eigen and Marc'Aurelio Ranzato and Ilya Sutskever},
journal= {arXiv preprint arXiv:1312.4314},
year = {2014}
}