ESVQA:基于感知质量的客体化空间视频评估
计算机视觉与模式识别
2025-08-08 v2 多媒体
摘要
随着扩展现实(XR)技术的快速发展,客体化空间拍摄和显示技术进一步增强了用户的沉浸感和参与感,提供了更引人入胜且互动的体验。确保客体化空间视频质量体验(Quality of Experience, QoE)至关重要,但相应的研究仍显不足。本文使用“具身体验”这一概念来凸显这种更加沉浸式的体验,并研究新的问题,即针对客体化空间视频的具身感知质量评估。具体而言,我们引入了第一个客体化空间视频质量评估数据库(Egocentric Spatial Video Quality Assessment Database, ESVQAD),该数据库包含600个使用Apple Vision Pro拍摄的客体化空间视频及其对应的平均意见分数(Mean Opinion Scores, MOSs)。此外,我们提出了一种新型的多维度双眼特征融合模型,称为ESVQAnet,该模型整合了双眼空间特征、动作特征和语义特征,用于预测整体感知质量。实验结果表明,ESVQAnet在具身感知质量评估任务上显著优于16种最先进的VQA模型,同时在传统VQA任务上表现出强大的泛化能力。该数据库和代码已公开于https://github.com/iamazxl/ESVQA。
引用
@article{arxiv.2412.20423,
title = {ESVQA: Perceptual Quality Assessment of Egocentric Spatial Videos},
author = {Xilei Zhu and Huiyu Duan and Liu Yang and Yucheng Zhu and Xiongkuo Min and Guangtao Zhai and Patrick Le Callet},
journal= {arXiv preprint arXiv:2412.20423},
year = {2025}
}
备注
6 pages, 3 figures