Q-Router: 基于专家模型路由与伪影定位的智能视频质量评估
计算机视觉与模式识别
2025-10-14 v2
摘要
视频质量评估(VQA)是一项基础的计算机视觉任务,旨在预测给定视频的感知质量,使其与人类判断保持一致。现有的基于直接分数监督训练的高性能 VQA 模型存在以下不足:(1)在多样化内容和任务上的泛化能力较差,涵盖用户生成内容(UGC)、短视频到人工智能生成内容(AIGC);(2)可解释性有限;(3)缺乏对新用例或内容类型的扩展性。我们提出了 Q-Router,一个用于通用 VQA 的智能体框架,采用多层模型路由系统。Q-Router 整合了一组多样化的专家模型,并利用视觉-语言模型(VLMs)作为实时路由器,根据输入视频语义动态推理并集成最合适的专家。我们基于计算预算构建了多层路由系统,最重的层级涉及特定的时空伪影定位以实现可解释性。这种智能体设计使 Q-Router 能够结合专业专家的互补优势,在异构视频来源和任务上实现灵活性与鲁棒性的统一。大量实验表明,Q-Router 在多种基准数据集上匹配或超越了最先进的 VQA 模型,同时显著提升了泛化能力和可解释性。此外,Q-Router 在基于质量的问答基准 Q-Bench-Video 上表现出色,展示了其作为下一代 VQA 系统基础的潜力。最后,我们证明 Q-Router 能够定位时空伪影,展现出作为视频生成模型后训练奖励函数的潜力。
引用
@article{arxiv.2510.08789,
title = {Q-Router: Agentic Video Quality Assessment with Expert Model Routing and Artifact Localization},
author = {Shuo Xing and Soumik Dey and Mingyang Wu and Ashirbad Mishra and Naveen Ravipati and Binbin Li and Hansi Wu and Zhengzhong Tu},
journal= {arXiv preprint arXiv:2510.08789},
year = {2025}
}