中文

ASTRA:让任意主体在视频编辑中进行变换

计算机视觉与模式识别 2026-04-15 v2

摘要

虽然现有的视频编辑方法在单一主体上表现优异,但在密集的多主体场景中仍感困难,常因注意力稀释和掩码边界交织导致属性泄漏和时间不稳定。为此,我们提出了ASTRA——一个无需训练的无缝、任意主体视频编辑框架。ASTRA无需模型微调,即可精确地操控多个指定主体,同时严格保留非目标区域。它通过两大核心组件实现:一个引导式多模态对齐模块生成稳健的条件以缓解注意力稀释,一个基于先验的掩码重新定位模块产生连贯的 temporally 掩码序列以解决边界交织。作为一个即插即用的通用模块,ASTRA可无缝集成到多样化的掩码驱动视频生成器中。对我们新构建的基准数据集MSVBench上的大量实验表明,ASTRA consistently 超越了最先进的方法。代码、模型和数据均可在 https://github.com/XWH-A/ASTRA 查阅。

关键词

引用

@article{arxiv.2510.01186,
  title  = {ASTRA: Let Arbitrary Subjects Transform in Video Editing},
  author = {Fei Shen and Weihao Xu and Rui Yan and Dong Zhang and Xiangbo Shu and Jinhui Tang and Maocheng Zhao},
  journal= {arXiv preprint arXiv:2510.01186},
  year   = {2026}
}