动态多媒体系统的在线强化学习
机器学习
2013-06-06 v1 多媒体
摘要
在我们之前的工作中,我们为动态多媒体系统提出了一个系统的跨层框架,该框架允许每一层做出自主且有远见的决策,以最大化系统的长期性能,同时满足应用的实时延迟约束。所提出的解决方案在假设多媒体系统的概率动态先验已知的情况下,离线解决了跨层优化问题。然而,在实践中,这些动态是先验未知的,因此必须在线学习。在本文中,我们通过允许多媒体系统层通过彼此重复交互来学习,从而在运行时自主优化系统的长期性能,解决了这个问题。我们提出了两种强化学习算法,用于在不同设计约束下优化系统:第一种算法以集中方式解决跨层优化,第二种算法以分散方式解决。我们从所需的计算、内存和层间通信开销方面分析了这两种算法。在注意到所提出的强化学习算法学习速度过慢后,我们引入了一种互补的加速学习算法,该算法利用关于系统动态的部分知识,以显著提高系统性能。在我们的实验中,我们证明了分散学习可以表现得与集中学习一样好,同时使各层能够自主行动。此外,我们表明,现有的与应用无关的强化学习算法,以及多媒体系统中现有的短视学习算法,其性能明显差于我们提出的应用感知且有远见的学习方法。
引用
@article{arxiv.0906.5325,
title = {Online Reinforcement Learning for Dynamic Multimedia Systems},
author = {Nicholas Mastronarde and Mihaela van der Schaar},
journal= {arXiv preprint arXiv:0906.5325},
year = {2013}
}
备注
35 pages, 11 figures, 10 tables