中文

ESVQA:基于感知质量的客体化空间视频评估

计算机视觉与模式识别 2025-08-08 v2 多媒体

摘要

随着扩展现实(XR)技术的快速发展,客体化空间拍摄和显示技术进一步增强了用户的沉浸感和参与感,提供了更引人入胜且互动的体验。确保客体化空间视频质量体验(Quality of Experience, QoE)至关重要,但相应的研究仍显不足。本文使用“具身体验”这一概念来凸显这种更加沉浸式的体验,并研究新的问题,即针对客体化空间视频的具身感知质量评估。具体而言,我们引入了第一个客体化空间视频质量评估数据库(Egocentric Spatial Video Quality Assessment Database, ESVQAD),该数据库包含600个使用Apple Vision Pro拍摄的客体化空间视频及其对应的平均意见分数(Mean Opinion Scores, MOSs)。此外,我们提出了一种新型的多维度双眼特征融合模型,称为ESVQAnet,该模型整合了双眼空间特征、动作特征和语义特征,用于预测整体感知质量。实验结果表明,ESVQAnet在具身感知质量评估任务上显著优于16种最先进的VQA模型,同时在传统VQA任务上表现出强大的泛化能力。该数据库和代码已公开于https://github.com/iamazxl/ESVQA。

关键词

引用

@article{arxiv.2412.20423,
  title  = {ESVQA: Perceptual Quality Assessment of Egocentric Spatial Videos},
  author = {Xilei Zhu and Huiyu Duan and Liu Yang and Yucheng Zhu and Xiongkuo Min and Guangtao Zhai and Patrick Le Callet},
  journal= {arXiv preprint arXiv:2412.20423},
  year   = {2025}
}

备注

6 pages, 3 figures