TextOVSR:面向真实世界歌剧视频的文本引导超分辨率
计算机视觉与模式识别
2026-03-17 v1
摘要
许多经典歌剧视频在视觉质量上表现不佳,这源于早期摄影设备的局限性以及长期存放的退化。虽然近年来真实世界视频超分辨率(RWVSR)取得了显著进展,但直接将现有方法应用于退化的歌剧视频仍具有挑战性。具体难点在于:首先,准确建模真实世界退化十分复杂,简单地将经典退化核组合无法捕捉真实的噪声分布,而依赖外部数据集提取真实噪声块的方法则容易出现风格不匹配导致视觉伪影;其次,当前的 RWVSR 方法仅依赖退化图像特征,难以重建真实且细致的纹理,因为缺乏高层次语义指导。为此,我们提出了 Text-guided Dual-Branch Opera Video Super-Resolution(TextOVSR)网络,引入两种文本提示来指导超分辨率过程。具体而言,从退化过程中派生的退化描述文本被整合到负分支,用于约束解的空间;同时,内容描述文本被整合到正分支中,并提出的 Text-Enhanced Discriminator(TED)用于为增强的纹理重建提供语义指导。此外,我们设计了 Degradation-Robust Feature Fusion(DRF)模块,以便在抑制退化干扰的同时促进跨模态特征融合。实验在我们构建的 OperaLQ 数据集上表明,TextOVSR 在定性和定量分析方面均优于最先进的方法。代码可在 https://github.com/ChangHua0/TextOVSR 查阅。
引用
@article{arxiv.2603.15153,
title = {TextOVSR: Text-Guided Real-World Opera Video Super-Resolution},
author = {Hua Chang and Xin Xu and Wei Liu and Jiayi Wu and Kui Jiang and Fei Ma and Qi Tian},
journal= {arXiv preprint arXiv:2603.15153},
year = {2026}
}