M3DDM+:基于改进掩码策略的改进视频外绘制
计算机视觉与模式识别
2026-01-19 v1
摘要
M3DDM 通过潜在扩散建模为视频外绘制提供了一个计算高效的框架。然而,在相机运动有限或外绘制区域较大等帧间信息受限的挑战性场景下,它表现出显著的质量退化——表现为空间模糊和时间不一致。我们将原因归结为掩码策略中的训练-推理不匹配:M3DDM 的训练在跨帧时应用随机的掩码方向和宽度,而推理则要求在整个视频过程中保持一致的方向性外绘制。为解决此问题,我们提出了 M3DDM+,它在训练期间对所有帧应用统一的掩码方向和宽度,随后对预训练的 M3DDM 模型进行微调。实验表明,M3DDM+ 在信息受限的场景下显著提高了视觉保真度和时间一致性,同时保持了计算效率。代码可在 https://github.com/tamaki-lab/M3DDM-Plus 获取。
引用
@article{arxiv.2601.11048,
title = {M3DDM+: An improved video outpainting by a modified masking strategy},
author = {Takuya Murakawa and Takumi Fukuzawa and Ning Ding and Toru Tamaki},
journal= {arXiv preprint arXiv:2601.11048},
year = {2026}
}
备注
proc. of IWAIT2026