中文

面向全方位视频修复的自然语言退化锚定

计算机视觉与模式识别 2025-07-22 v1 人工智能 机器学习 图像与视频处理

摘要

本 work 提出一种全方位视频修复框架,通过基础模型在自然语言中对视频帧的退化感知语义上下文进行锚定,提供可解释且灵活的指导。不同于 prior art,我们的方法在训练和测试时间均不假设退化知识,通过学习近似的锚定知识,使基础模型在推理时能够安全地解耦,无需额外计算成本。进一步,我们呼吁对全方位视频修复进行基准化,并提出两个多退化设置基准:三任务(3D)和四任务(4D),以及两个随时间变化的复合退化基准;其中后者者者之一是我们提出的数据集,包含可变雪强度,模拟天气退化如何自然影响视频。我们与prior work进行比较,在所有基准上报告了最先进的性能。

关键词

引用

@article{arxiv.2507.14851,
  title  = {Grounding Degradations in Natural Language for All-In-One Video Restoration},
  author = {Muhammad Kamran Janjua and Amirhosein Ghasemabadi and Kunlin Zhang and Mohammad Salameh and Chao Gao and Di Niu},
  journal= {arXiv preprint arXiv:2507.14851},
  year   = {2025}
}

备注

17 pages