用于图像质量评估的 Transformer
计算机视觉与模式识别
2021-08-11 v2 机器学习
图像与视频处理
摘要
Transformer 已成为自然语言处理(NLP)中的新标准方法,同时也引起了计算机视觉领域的研究兴趣。在本文中,我们研究了 Transformer 在图像质量(TRIQ)评估中的应用。遵循 Vision Transformer(ViT)中采用的原始 Transformer 编码器,我们提出了一种在卷积神经网络(CNN)提取的特征图之上使用浅层 Transformer 编码器的架构。Transformer 编码器中采用自适应位置嵌入以处理任意分辨率的图像。已在公开可用的图像质量数据库上研究了不同 Transformer 架构的设置。我们发现所提出的 TRIQ 架构取得了出色的性能。TRIQ 的实现已发布于 Github(https://github.com/junyongyou/triq)。
引用
@article{arxiv.2101.01097,
title = {Transformer for Image Quality Assessment},
author = {Junyong You and Jari Korhonen},
journal= {arXiv preprint arXiv:2101.01097},
year = {2021}
}