VRMDiff:基于擴散模型的文本引導視頻指涉繪製生成
计算机视觉与模式识别
2025-03-17 v1
摘要
我們提出了一個新任務——視頻指涉繪製(video referring matting),通過輸入指涉描述獲得指定實例的 alpha 遮罩。我們將繪製任務視為視頻生成,利用視頻擴散模型的文本-視頻對齊先驗來生成與相應語義實例相關且在時間上連貫的 alpha 遮罩。此外,我們提出了新的 Latent-Constructive loss 以進一步區分不同的實例,實現更可控的互動繪製。我們還引入了一個大型視頻指涉繪製數據集,包含 10,000 個視頻。至我們知曉,這是第一個同時包含描述、視頻和實例級 alpha 遮罩的數據集。大量實驗證明了我們方法的有效性。數據集和代碼均可在 https://github.com/Hansxsourse/VRMDiff 獲得。
引用
@article{arxiv.2503.10678,
title = {VRMDiff: Text-Guided Video Referring Matting Generation of Diffusion},
author = {Lehan Yang and Jincen Song and Tianlong Wang and Daiqing Qi and Weili Shi and Yuheng Liu and Sheng Li},
journal= {arXiv preprint arXiv:2503.10678},
year = {2025}
}