中文

面向统一视频质量评估

计算机视觉与模式识别 2025-12-03 v1

摘要

近期的视频质量评估(VQA)工作通常采用单一的单质量模型,对每个测试视频预测单个质量分数。这些方法无法提供诊断性、可解释的反馈,几乎无法提供视频质量降解的原因。大多数方法也针对特定格式,属于专业化的、格式相关的指标,而非真正意义上的“通用”解决方案,因为它们旨在从分散的感知领域学习折中的表示。为克服这些限制,本文提出了 Unified-VQA 框架,将通用 VQA 重构为诊断性混合专家(Mixture-of-Experts, MoE)问题。Unified-VQA 采用多个专注于不同感知领域的“感知专家”。设计了新的多代理专家训练策略,利用最适合其领域的代理指标指导每个专家使用基于排序的损失函数进行优化。我们还将诊断性多任务头集成到该框架中,以生成全局质量分数和可解释的多维损害向量,该向量采用弱监督学习策略进行优化,利用本工作生成的大规模训练数据库已知属性。使用不进行再训练或微调的静态模型参数,Unified-VQA 在包含 HD、UHD、HDR 和 HFR 格式中多样化流式传输损害的 17 个数据库中,对通用 VQA 和诊断性损害检测任务均显示出一致且优于 18 多个基准方法的优异性能。本工作代表了向实用、可操作且可解释视频质量评估迈出的重要一步。

关键词

引用

@article{arxiv.2512.02224,
  title  = {Towards Unified Video Quality Assessment},
  author = {Chen Feng and Tianhao Peng and Fan Zhang and David Bull},
  journal= {arXiv preprint arXiv:2512.02224},
  year   = {2025}
}

备注

8 pages, 3 figures