面向野外视频质量评估中鲁棒文本提示语义准则的研究
计算机视觉与模式识别
2023-05-01 v1
摘要
在野外自然环境中采集的视频的激增推动了有效视频质量评估(VQA)方法的发展。当代有监督的基于主观意见驱动的 VQA 策略主要依赖于从昂贵的人类质量分数标注中进行训练,这限制了 VQA 数据集的规模与分布,并进而导致由这些数据驱动的方法泛化能力不佳。另一方面,尽管若干手工设计的零样本质量指标无需从人类意见中训练,它们无法考虑视频的语义,致使难以理解复杂的真实失真(如白平衡、曝光)并评估视频内语义内容的质量。为应对这些挑战,我们引入使用对比语言-图像预训练(CLIP)的文本提示语义亲和质量指数(SAQI)及其局部版本(SAQI-Local),以确定文本提示与视觉特征间的亲和性,从而在不依赖人类质量标注的情况下全面考察语义质量问题。通过将 SAQI 与现有低级指标融合,我们提出统一的盲视频质量指数(BVQI)及其改进版 BVQI-Local,其展现出前所未有的性能,在所有数据集上超越现有零样本指标至少 24%。此外,我们为 BVQI-Local 设计了一种高效的微调方案,联合优化文本提示与最终融合权重,相比主流意见驱动 VQA 方法取得了最先进的性能与更优的泛化能力。我们进行了全面分析以探究不同指标所关注的质量问题,证明了我们设计的有效性与合理性。
引用
@article{arxiv.2304.14672,
title = {Towards Robust Text-Prompted Semantic Criterion for In-the-Wild Video Quality Assessment},
author = {Haoning Wu and Liang Liao and Annan Wang and Chaofeng Chen and Jingwen Hou and Wenxiu Sun and Qiong Yan and Weisi Lin},
journal= {arXiv preprint arXiv:2304.14672},
year = {2023}
}
备注
13 pages, 10 figures, under review