基于缓冲图签名的元强化学习用于直播视频流事件
网络与互联网体系结构
2021-11-19 v1 人工智能
机器学习
摘要
在本研究中,我们提出了一种元学习模型,以适配参与直播视频流事件的观众之间网络容量的预测。我们提出了 MELANIE 模型,其中将一个事件建模为马尔可夫决策过程,在强化学习任务上执行元学习。通过将一个新事件视为一个任务,我们设计了一种 actor-critic 学习方案来计算估计观众高带宽连接的最优策略。为确保对事件期间观众间新连接或变化的快速适配,我们基于观众连接的奖励/吞吐量的 Kullback-Leibler 散度实现了一种优先经验回放缓冲区。此外,我们采用与模型无关的元学习框架从过往事件生成全局模型。由于观众很少参与多个事件,挑战在于如何考量不同事件的低结构相似性。为应对此问题,我们设计了一种图签名缓冲区来计算若干流媒体事件的结构相似性,并相应地调整全局模型的训练。我们在三个真实世界直播视频流事件数据集的链路权重预测任务上评估了所提模型。我们的实验证明了所提模型的有效性,相对于最先进策略平均相对增益达 25%。出于复现目的,我们的评估数据集与实现已公开于 https://github.com/stefanosantaris/melanie
引用
@article{arxiv.2111.09412,
title = {Meta-Reinforcement Learning via Buffering Graph Signatures for Live Video Streaming Events},
author = {Stefanos Antaris and Dimitrios Rafailidis and Sarunas Girdzijauskas},
journal= {arXiv preprint arXiv:2111.09412},
year = {2021}
}