Point2Insert:基于稀疏点的视频对象插入
计算机视觉与模式识别
2026-02-05 v1
摘要
本文提出 Point2Insert,一个稀疏点驱动的框架,用于视频中的灵活且用户友好的对象插入,源于准确、低-effort 对象放置日益受到欢迎。现有方法面临两个主要挑战:基于掩码的插入方法需要耗时的掩码标注,而基于指令的方法难以在精确位置放置对象。Point2Insert 通过仅要求少量稀疏点而非密集掩码来解决这些问题,消除繁琐的掩码绘制需求。具体而言,它支持正负点以指示适合或不适合插入的区域,从而实现对对象位置的细粒度空间控制。Point2Insert 的训练包含两个阶段。在阶段 1,我们训练插入模型以生成给定区域内的对象,条件可为稀疏点提示或二值掩码。在阶段 2,我们进一步在由对象移除模型合成的配对视频上训练模型,使其适应视频插入。此外,受掩码引导编辑插入成功率更高的启发,我们利用掩码引导的插入模型作为教师,将可靠的插入行为蒸馏到点引导模型中。广泛的实验表明,Point2Insert 持续优于强大的基线方法,即使参数数目少于它们的 10。
引用
@article{arxiv.2602.04167,
title = {Point2Insert: Video Object Insertion via Sparse Point Guidance},
author = {Yu Zhou and Xiaoyan Yang and Bojia Zi and Lihan Zhang and Ruijie Sun and Weishi Zheng and Haibin Huang and Chi Zhang and Xuelong Li},
journal= {arXiv preprint arXiv:2602.04167},
year = {2026}
}