中文

面向用户生成全景视频的音视频质量评估数据集与方法研究

计算机视觉与模式识别 2025-06-13 v1 图像与视频处理

摘要

鉴于元宇宙的兴起,全景视频(Omnidirectional Video, ODV)正逐渐从专业生成内容(PGC)转向用户生成内容(UGC),备受关注。然而,ODV 内部的音视频质量评估(Audio-Visual Quality Assessment, AVQA)研究仍有限。为此,本文构建了一个由用户生成全景音视频(A/V)内容组成的数据集。该数据集中的视频由五名摄影师使用两种不同类型的全景摄像机拍摄,覆盖10种不同的场景类型,共计300个视频。对数据集进行主观 AVQA 实验,以获得音视频序列的平均意见分数(Mean Opinion Scores, MOSs)。随后,构建了一个有效的 UGC-ODV AVQA 基线模型,该模型由视频特征提取模块、音频特征提取和音视频融合模块组成。实验结果表明,该模型在所提出的数据集上取得最佳性能。

关键词

引用

@article{arxiv.2506.10331,
  title  = {Research on Audio-Visual Quality Assessment Dataset and Method for User-Generated Omnidirectional Video},
  author = {Fei Zhao and Da Pan and Zelu Qi and Ping Shi},
  journal= {arXiv preprint arXiv:2506.10331},
  year   = {2025}
}

备注

Our paper has been accepted by ICME 2025