受视觉机制启发的高效Transformer用于图像与视频质量评价
图像与视频处理
2022-08-23 v3 计算机视觉与模式识别
摘要
视觉(图像、视频)质量评价可通过不同域(如空间域、频率域、时域)中的视觉特征建模。人类视觉系统(HVS)中的感知机制在质量感知生成中起关键作用。本文提出一种利用高效窗口化 transformer 架构的无参考视觉质量评价通用框架。将轻量级多阶段通道注意力模块集成进 Swin(移位窗口)Transformer,该模块能表征图像质量评价(IQA)中恰当的感知机制以构建准确的 IQA 模型。同时,可从 IQA 模型导出空间域与频率域中图像质量感知的代表性特征,并将其输入另一窗口化 transformer 架构用于视频质量评价(VQA)。该 VQA 模型高效复用局部窗口间的注意力信息,以解决原始 transformer 高昂的时间与内存复杂度问题。在大规模 IQA 与 VQA 数据库上的实验结果表明,所提质量评价模型大幅优于其他最先进模型。完整源代码将发布于 Github。
引用
@article{arxiv.2203.14557,
title = {Visual Mechanisms Inspired Efficient Transformers for Image and Video Quality Assessment},
author = {Junyong You and Zheng Zhang},
journal= {arXiv preprint arXiv:2203.14557},
year = {2022}
}