面向盲人视频质量评估的文本引导式解耦式视觉语言建模:DVLTA-VQA
计算机视觉与模式识别
2025-04-22 v3
摘要
受人类视觉系统双流理论的启发——其中视网膤流负责物体识别和细节分析,背部流专注于空间关系和运动感知——不断有视频质量评估(VQA)工作基于此框架展开。近期大型多模态模型(尤其是 Contrastive Language-Image Pretraining, CLIP)的进步,激发了研究者将 CLIP 融入双流式 VQA 方法的动力。这一整合旨在利用模型的语义理解能力,模拟视网膤流中的物体识别与细节分析,以及背部流中的空间关系分析。然而,CLIP 原为图像设计,缺乏捕获视频固有时序和运动信息的能力。为此,本文提出一种面向盲人视频质量评估的文本引导式解耦式视觉语言建模方法(DVLTA-VQA),将 CLIP 的视觉与文本组件解耦,分别融入 NR-VQA 流程的不同阶段。具体而言,提出一种基于视频的时序 CLIP 模块,显式建模时序动态,增强运动感知,契合背部流;此外,开发时序上下文模块以细化帧间依赖关系,进一步提升运动建模。在视网膤流方面,采用基础视觉特征提取模块以强化细节分析。最后,提出文本引导式自适应融合策略,实现特征的动态加权,更有效地整合空间与时序信息。
引用
@article{arxiv.2504.11733,
title = {DVLTA-VQA: Decoupled Vision-Language Modeling with Text-Guided Adaptation for Blind Video Quality Assessment},
author = {Li Yu and Situo Wang and Wei Zhou and Moncef Gabbouj},
journal= {arXiv preprint arXiv:2504.11733},
year = {2025}
}