虚拟现实中对鲁棒且资源高效的机器学习辅助视口预测
计算机视觉与模式识别
2022-12-21 v1 人工智能
摘要
近年来,由于头戴式显示器(HMD)与全景相机的快速发展,360 度全景视频受到了相当多的关注。流传输全景视频的一个主要问题在于,相较于传统视频,全景视频的尺寸要大得多。此外,用户设备常处于无线环境中,电池、计算能力与带宽均有限。为降低资源消耗,研究者提出了预测用户视口的方法,从而只需从服务器传输整个视频的一部分。然而,此类预测方法的鲁棒性在文献中被忽视了:通常假设仅将基于过往用户经验预训练的少数模型应用于所有用户的预测。我们观察到,那些预训练模型对某些用户可能表现很差,因为这些用户的行为可能与大多数用户截然不同,且预训练模型无法捕捉未见视频中的特征。在本工作中,我们提出一种基于元学习的新视口预测范式,以缓解最差预测性能并保障视口预测的鲁棒性。该范式使用两个机器学习模型,其中第一个模型预测观看方向,第二个模型预测可包含实际视口的最小视频预取大小。我们首先训练两个元模型使其对新训练数据敏感,然后在用户观看视频时将其快速适配至相应用户。评估结果表明,元模型能够快速适配每位用户,并显著提升预测准确率,尤其是对于表现最差的预测。
引用
@article{arxiv.2212.09945,
title = {Robust and Resource-efficient Machine Learning Aided Viewport Prediction in Virtual Reality},
author = {Yuang Jiang and Konstantinos Poularakis and Diego Kiedanski and Sastry Kompella and Leandros Tassiulas},
journal= {arXiv preprint arXiv:2212.09945},
year = {2022}
}
备注
Accepted for publication in 2022 IEEE International Conference on Big Data (IEEE BigData 2022)