探索用于高分辨率视频质量评估的简单孪生网络
计算机视觉与模式识别
2025-03-05 v1
摘要
在视频质量评估(VQA)研究中,双分支网络已成为一种极具前景的解决方案。它通过独立的技术分支和美学分支将 VQA 解耦,分别测量对低层失真和高层语义的感知。然而,我们认为,尽管技术与美学视角是互补的,但技术视角本身应以语义感知的方式进行测量。我们假设,现有的技术分支由于是在从视频中采样的局部小图块上训练的,因此难以感知高分辨率视频的语义。这一问题在低分辨率视频上看似良好的结果中可能被掩盖,但实际上对高分辨率 VQA 至关重要。本工作提出了 SiamVQA,一种用于高分辨率 VQA 的简单但有效的孪生网络。SiamVQA 在技术分支和美学分支之间共享权重,增强了技术分支的语义感知能力,以促进技术质量表示学习。此外,它还集成了一个双重交叉注意力层,用于融合技术和美学特征。SiamVQA 在高分辨率基准测试上达到了 SOTA 的准确率,并在较低分辨率基准测试上取得了有竞争力的结果。代码将在以下地址提供:https://github.com/srcn-ivl/SiamVQA
引用
@article{arxiv.2503.02330,
title = {Exploring Simple Siamese Network for High-Resolution Video Quality Assessment},
author = {Guotao Shen and Ziheng Yan and Xin Jin and Longhai Wu and Jie Chen and Ilhyun Cho and Cheul-Hee Hahm},
journal= {arXiv preprint arXiv:2503.02330},
year = {2025}
}
备注
Accepted by ICASSP 2025