CineMatte:面向虚拟制作及更广领域的背景抠图
计算机视觉与模式识别
2026-05-19 v1
摘要
LED 虚拟制作(VP)利用大型 LED 体积实时渲染背景,实现了机内视觉特效,但也使得后期修改变得极其耗时。我们通过提出 CineMatte 来解决这一问题,这是一个适用于 VP 及更广领域的鲁棒背景抠图框架。CineMatte 采用了交叉注意力条件设计。CineMatte 没有将背景与输入拼接,而是采用具有共享权重的连体、冻结 DINOv3 Vision Transformer 分别对输入帧和捕获的背景进行编码。交叉注意力模块比较这两个流以预测前景,从而保留了预训练语义并提高了对背景变化的鲁棒性。以往基于 ViT 的抠图模型使用并行的卷积“细节分支”来恢复精细细节,但由于与主干网络存在语义不对齐,这会在真实样本中产生边界伪影。我们转而使用预训练的、图像引导的特征上采样器来替代它,这极大地缓解了该问题。我们还引入了 CineMatte-4K,这是一个在专业 LED VP 摄影棚拍摄的数据集,包含 4K HDR 图像和视频。据我们所知,其图像子集是首个用于 VP 抠图的非合成数据集,通过绿幕插入方式获取;视频子集包含带有跟踪轨迹的摄像机运动,以便后续能够以正确的视差渲染任意背景。在 CineMatte-4K 和公开基准(VideoMatte240K、YouTubeMatte)上的测试表明,CineMatte 不仅在 VP 中表现出色,还能鲁棒地泛化至真实世界视频素材。
引用
@article{arxiv.2605.18328,
title = {CineMatte: Background Matting for Virtual Production and Beyond},
author = {Yuanjian He and Chen Zhang and Fasheng Chen and Jiangbo Cao},
journal= {arXiv preprint arXiv:2605.18328},
year = {2026}
}