CLEAR:基于上下文感知的端到端无掩码自适应视频字幕去除
计算机视觉与模式识别
2026-05-12 v2
摘要
视频字幕去除旨在区分文本叠加层与背景内容,同时保持时间一致性。现有扩散方法在训练和推理阶段均需要显式的掩码序列,这限制了其实际部署。在本文中,我们提出CLEAR(Context-aware Learning for End-to-end Adaptive Video Subtitle Removal),一个无掩码框架,通过上下文感知的自适应学习实现真正的端到端推理。我们的两阶段设计将先验提取与生成细化解耦:阶段I通过对双编码器的自监督正交约束学习解缠字幕表示,而阶段II采用LoRA-based适配并结合生成反馈进行动态上下文调整。值得注意的是,我们的方法仅需基础扩散模型参数的0.77%即可完成训练。在中文字幕基准测试中,CLEAR相较于依赖掩码的基线方法在PSNR上提升6.77 dB,在VFID上降低74.7%,同时在六种语言(英、韩、法、日、俄、德)上实现优异的零样本泛化,得益于我们基于生成反馈的机制,在推理阶段无需真实掩码即可实现稳健的字幕去除。
引用
@article{arxiv.2603.21901,
title = {CLEAR: Context-Aware Learning with End-to-End Mask-Free Inference for Adaptive Video Subtitle Removal},
author = {Qingdong He and Chaoyi Wang and Peng Tang and Yifan Yang and Xiaobin Hu},
journal= {arXiv preprint arXiv:2603.21901},
year = {2026}
}
备注
Accepted by ICML 2026 (Spotlight)