Tiyuntsong:一种用于 ABR 视频流的自博弈强化学习方法
多媒体
2019-05-03 v3
摘要
现有基于强化学习(RL)的自适应码率(ABR)方法通过提升体验质量(QoE)得分优于先前基于固定控制规则的方法,但由于 QoE 指标难以提供明确的优化指导,最终导致出乎意料策略。本文提出 \emph{Tiyuntsong},一种基于生成对抗网络(GAN)的自博弈强化学习方法用于 ABR 视频流。Tiyuntsong 通过训练两个相互竞争的智能体自动学习策略。注意竞争结果由一组规则而非数值 QoE 得分决定,从而允许更清晰的优化目标。同时,我们提出 GAN 增强模块从过去状态中提取隐藏特征以保留信息,且不受序列长度限制。通过测试床实验,我们表明 GAN 的使用显著提升了 Tiyuntsong 的性能。通过比较 ABR 的性能,我们观察到 Tiyuntsong 在底层指标上也优于现有 ABR 算法。
引用
@article{arxiv.1811.06166,
title = {Tiyuntsong: A Self-Play Reinforcement Learning Approach for ABR Video Streaming},
author = {Tianchi Huang and Xin Yao and Chenglei Wu and Rui-Xiao Zhang and Zhangyuan Pang and Lifeng Sun},
journal= {arXiv preprint arXiv:1811.06166},
year = {2019}
}
备注
Published in ICME 2019