中文

MoA-VR:面向全方位视频修复的混合智能体系统

计算机视觉与模式识别 2025-10-10 v1

摘要

现实视频常因多样化的采集与传输条件而遭受复杂退化,如噪声、压缩伪影和低光失真。现有修复方法通常需要专业人工挑选专用模型,或依赖单一架构,难以适应不同程度的退化。灵感来源于专家经验,我们提出MoA-VR——首个混合智能体视频修复系统,通过三个协调的智能体模拟人类专业人员的推理与处理流程:退化识别、路由与修复、以及修复质量评估。具体而言,我们构建了大规模高分辨率视频退化识别基准数据集,并开发了驱动型退化识别器。我们进一步引入由大语言模型(LLM)驱动的自适应路由器,通过观察工具使用模式自动学习有效的修复策略。为评估中间和最终处理后的视频质量,我们构建了恢复视频质量(Res-VQ)数据集,并设计了专为修复任务量身定制的VLM基视频质量评估模型。大量实验表明,MoA-VR能有效处理多样化和复合退化,在客观指标与感知质量方面均优于现有基线。这些结果凸显了多模态智能与模块化推理在通用视频修复系统中的潜力。

关键词

引用

@article{arxiv.2510.08508,
  title  = {MoA-VR: A Mixture-of-Agents System Towards All-in-One Video Restoration},
  author = {Lu Liu and Chunlei Cai and Shaocheng Shen and Jianfeng Liang and Weimin Ouyang and Tianxiao Ye and Jian Mao and Huiyu Duan and Jiangchao Yao and Xiaoyun Zhang and Qiang Hu and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2510.08508},
  year   = {2025}
}