中文

不要展平, tokenize!解析SoftMoE在深度强化学习中的有效性关键因素

机器学习 2025-02-28 v2 人工智能

摘要

深度神经网络在强化学习(RL)中的应用通常会随模型规模增大而出现性能下降。虽然软专家混合(SoftMoE)最近在缓解此问题方面显示出前景,但其有效性背后的原因仍 largely 未知。本文提供了深入分析,确定驱动性能提升的关键因素。我们发现,单纯对编码器输出进行 tokenize,而非多个专家的使用,正是SoftMoE有效性的关键所在。事实上,我们演示了即使使用合理规模的单个专家,也能保持性能提升,主要归功于 tokenize。

关键词

引用

@article{arxiv.2410.01930,
  title  = {Don't flatten, tokenize! Unlocking the key to SoftMoE's efficacy in deep RL},
  author = {Ghada Sokar and Johan Obando-Ceron and Aaron Courville and Hugo Larochelle and Pablo Samuel Castro},
  journal= {arXiv preprint arXiv:2410.01930},
  year   = {2025}
}