中文

EyeSim-VQA: 一种自由能引导的眼动模拟框架用于视频质量评估

计算机视觉与模式识别 2025-06-16 v1 图像与视频处理

摘要

自由能引导的自修复机制在图像质量评估(IQA)中已展现出有前景的结果,但在视频质量评估(VQA)中仍未被充分探索,其中时间动态和模型约束带来了独特的挑战。与静态图像不同,视频内容展现出更丰富的时空复杂性,使得感知恢复更加困难。此外,VQA 系统通常依赖预训练骨干网络,这限制了增强模块在不影响模型稳定性的前提下直接集成。为解决这些问题,我们提出了 EyeSimVQA,一个融合自由能自修复的新型 VQA 框架。它采用双分支架构,包含一个用于全局感知评估的美学分支和一个用于细粒度结构和语义分析的技术分支。每个分支集成了专门设计的增强模块,分别针对调整尺寸的全帧图像和基于块的片段进行定制,以模拟自适应修复行为。我们还探索了一种不破坏原始骨干网络的前提下融入高层视觉特征的原则性策略。此外,我们设计了一个受生物启发的预测头,用于模拟扫描眼动动态,以更好地融合全局和局部表示进行质量预测。在五个公开 VQA 基准上的实验表明,EyeSimVQA 达到了与最先进方法相当或更优的性能,同时通过其生物启发式设计提供了更好的可解释性。

关键词

引用

@article{arxiv.2506.11549,
  title  = {EyeSim-VQA: A Free-Energy-Guided Eye Simulation Framework for Video Quality Assessment},
  author = {Zhaoyang Wang and Wen Lu and Jie Li and Lihuo He and Maoguo Gong and Xinbo Gao},
  journal= {arXiv preprint arXiv:2506.11549},
  year   = {2025}
}

备注

This work has been submitted to the IEEE TCSVT for possible publication