弥合全景视频视觉质量评估与人行为之间的鸿沟:大规模数据集与深度学习模型
计算机视觉与模式识别
2018-07-31 v1
摘要
全景视频提供具有 视域范围的球面刺激。同时,观察者仅能通过头部运动(HM)看到全景视频的视口区域,而视口内更小区域可通过眼球运动(EM)被清晰感知。因此,全景视频的主观质量可能与人类行为的 HM 和 EM 相关。为填补主观质量与人类行为之间的鸿沟,本文提出一个名为 VQA-OV 的大规模全景视频视觉质量评估(VQA)数据集,其收集了 60 个参考序列与 540 个受损序列。我们的 VQA-OV 数据集不仅提供序列的主观质量分数,还提供受试者的 HM 与 EM 数据。通过挖掘该数据集,我们发现全景视频的主观质量确实与 HM 和 EM 相关。据此,我们开发了嵌入 HM 与 EM 的深度学习模型,用于全景视频的客观 VQA。实验结果表明,我们的模型显著提升了全景视频 VQA 的 SOTA 性能。
引用
@article{arxiv.1807.10990,
title = {Bridge the Gap Between VQA and Human Behavior on Omnidirectional Video: A Large-Scale Dataset and a Deep Learning Model},
author = {Chen Li and Mai Xu and Xinzhe Du and Zulin Wang},
journal= {arXiv preprint arXiv:1807.10990},
year = {2018}
}
备注
Accepted by ACM MM 2018