中文

迈向可解释的野生视频质量评估:一个数据库与一种语言提示方法

计算机视觉与模式识别 2023-08-04 v2 计算与语言 多媒体

摘要

野生视频的激增极大拓展了视频质量评估(VQA)问题。不同于早期通常聚焦有限失真类型的定义,野生视频上的 VQA 尤为困难,因其受复杂因素影响,包括各类失真与多样内容。尽管主观研究已为这些视频收集了整体质量分数,但抽象质量分数与具体因素的关系仍不明晰,阻碍 VQA 方法给出更具体的质量评价(如视频的清晰度)。为解决此问题,我们针对 4,543 个野生视频在 13 个质量相关因素维度上收集了逾两百万条意见,涵盖拍摄内固有失真(如运动模糊、噪声、闪烁)、压缩与传输引入的错误,以及语义内容与美学问题(如构图、相机轨迹)等高层体验,从而建立多维 Maxwell 数据库。具体而言,我们让受试者在每一维度上从正面、负面与中性选项中标注。这些解释级意见使我们能度量具体质量因素与抽象主观质量评分间的关系,并在各维度上对不同类别 VQA 算法进行基准测试,从而更全面地分析其优劣。此外,我们提出 MaxVQA,一种语言提示 VQA 方法,修改视觉-语言基础模型 CLIP 以更好捕捉我们分析中所观测的重要质量问题。MaxVQA 能以全维度 SOTA 精度联合评估各类具体质量因素与最终质量分数,并在现有数据集上具备优异泛化能力。代码与数据见 https://github.com/VQAssessment/MaxVQA。

关键词

引用

@article{arxiv.2305.12726,
  title  = {Towards Explainable In-the-Wild Video Quality Assessment: A Database and a Language-Prompted Approach},
  author = {Haoning Wu and Erli Zhang and Liang Liao and Chaofeng Chen and Jingwen Hou and Annan Wang and Wenxiu Sun and Qiong Yan and Weisi Lin},
  journal= {arXiv preprint arXiv:2305.12726},
  year   = {2023}
}

备注

Proceedings of the 31st ACM International Conference on Multimedia (MM '23)