中文

卷积也需要寄存器:受 HVS 启发的视频质量评估动态注意力

图像与视频处理 2026-01-19 v1 计算机视觉与模式识别 多媒体

摘要

无参考视频质量评估 (NR-VQA) 在没有参考视频的情况下估计感知质量,这通常具有挑战性。虽然最近的技术利用了显著性或 Transformer 注意力,但它们仅仅通过使用静态图作为辅助输入将上下文作为辅助输入,而没有将上下文从根本上嵌入到视频序列的特征提取中。我们提出了用于视频质量评估的带全局寄存器的动态注意力 (DAGR-VQA),这是第一个将 register-token 直接集成到卷积主干网络中以进行时空、动态显著性预测的框架。通过将可学习的 register tokens 作为全局上下文载体嵌入,我们的模型实现了动态的、受人类视觉系统 (HVS) 启发的注意力,生成随时间跟踪显著区域的、时间自适应的显著性图,而无需显式的运动估计。我们的模型将动态显著性图与 RGB 输入集成,捕获空间数据并通过时间 Transformer 对其进行分析,以提供感知一致的视频质量评估。在 LSVQ、KonVid-1k、LIVE-VQC 和 YouTube-UGC 数据集上进行的综合测试表明,其性能极具竞争力,超越了大多数顶级基线。关于消融研究的表明,register tokens 的集成促进了稳定和时间一致的注意力机制的发展。DAGR-VQA 在 1080p 下达到了 387.7 FPS 的效率,展示了适用于多媒体流系统等实时应用的计算性能。

关键词

引用

@article{arxiv.2601.11045,
  title  = {Convolutions Need Registers Too: HVS-Inspired Dynamic Attention for Video Quality Assessment},
  author = {Mayesha Maliha R. Mithila and Mylene C. Q. Farias},
  journal= {arXiv preprint arXiv:2601.11045},
  year   = {2026}
}

备注

Accepted at ACM MMSys 2026. 12 pages, 8 figures. No supplementary material