中文

用于高效端到端视频质量评估的邻域代表性采样

计算机视觉与模式识别 2022-10-12 v1 人工智能 多媒体

摘要

真实世界视频分辨率的提高给深度视频质量评估(VQA)在效率与准确性之间带来了两难境地。一方面,保持原始分辨率将导致不可接受的计算成本。另一方面,现有的做法(如缩放和裁剪)会因细节和内容的丢失而改变原始视频的质量,因此对质量评估有害。通过从人类视觉系统和视觉编码理论中的时空冗余研究获得启发,我们观察到邻域附近的质量信息通常是相似的,这促使我们为 VQA 研究一种有效的质量敏感邻域代表方案。在本工作中,我们提出了一种统一方案——时空网格微立方体采样,以获取一种名为片段的新型样本。首先将全分辨率视频划分为具有预设时空网格的微立方体,然后采样时间对齐的质量代表以组成片段,这些片段作为 VQA 的输入。此外,我们设计了片段注意力网络,这是一种专门为片段量身定制的网络架构。借助片段和 FANet,所提出的高效端到端 FAST-VQA 和 FasterVQA 在所有 VQA 基准测试上的性能均显著优于现有方法,同时所需的 FLOPs 仅为当前 SOTA 的 1/1612。代码、模型和演示可在 https://github.com/timothyhtimothy/FAST-VQA-and-FasterVQA 获取。

关键词

引用

@article{arxiv.2210.05357,
  title  = {Neighbourhood Representative Sampling for Efficient End-to-end Video Quality Assessment},
  author = {Haoning Wu and Chaofeng Chen and Liang Liao and Jingwen Hou and Wenxiu Sun and Qiong Yan and Jinwei Gu and Weisi Lin},
  journal= {arXiv preprint arXiv:2210.05357},
  year   = {2022}
}