中文

MatAnyone 2:通过学习质量评估器扩展视频抠像

计算机视觉与模式识别 2026-03-17 v2

摘要

视频抠像仍然受限于现有数据集的规模与真实感。尽管利用分割数据可以增强语义稳定性,但缺乏有效的边界监督往往导致产生类似分割的抠像结果,缺乏精细细节。为此,我们引入了学习型抠像质量评估器(MQE),它能够在没有真值的情况下评估 alpha 抠像的语义与边界质量。它生成逐像素的评估图,以识别可靠与错误区域,从而实现细粒度的质量评估。MQE 通过两种方式扩展了视频抠像:(1)作为训练期间的在线抠像质量反馈,以抑制错误区域并提供全面监督;(2)作为数据筛选的离线选择模块,通过结合领先视频与图像抠像模型的优势来提高标注质量。这一过程使我们能够构建一个大规模真实世界视频抠像数据集 VMReal,包含 28K 个片段和 2.4M 帧。为了处理长视频中巨大的外观变化,我们引入了一种参考帧训练策略,该策略将局部窗口之外的长程帧纳入以进行有效训练。我们的 MatAnyone 2 在合成与真实世界基准测试中均取得了 SOTA 性能,在所有指标上超越了以往方法。

关键词

引用

@article{arxiv.2512.11782,
  title  = {MatAnyone 2: Scaling Video Matting via a Learned Quality Evaluator},
  author = {Peiqing Yang and Shangchen Zhou and Kai Hao and Qingyi Tao},
  journal= {arXiv preprint arXiv:2512.11782},
  year   = {2026}
}

备注

Accepted to CVPR 2026. Project page: https://pq-yang.github.io/projects/MatAnyone2/