VimTS:用于增强跨域泛化的统一视频和图像文本捕捉器
计算机视觉与模式识别
2024-12-06 v4 人工智能
摘要
文本捕捉是指从图像或视频序列中提取文本信息的任务,面临跨域适应挑战,如图像到图像和图像到视频的泛化。在本文中,我们引入了一种新方法,称为VimTS,通过实现不同任务之间的更好协同作用来增强模型的泛化能力。通常,我们提出了Prompt Queries Generation Module和Tasks-aware Adapter,以有效地将原始单任务模型转换为适用于图像和视频场景的多任务模型,所需的额外参数最小。Prompt Queries Generation Module促进了不同任务之间的显式交互,而Tasks-aware Adapter帮助模型动态学习适合每个任务的特征。此外,为了进一步以较低成本学习temporal信息,我们提出了通过Content Deformation Fields(CoDeF)算法生成的合成视频文本数据集(VTD-368k)。值得注意的是,我们的方法在六个跨域基准测试(如TT-to-IC15、CTW1500-to-TT和TT-to-CTW1500)上的平均性能提升了2.6%。对于视频级别的跨域适应,我们的方法甚至在ICDAR2015视频和DSText v2上使用仅来自图像级数据的平均MOTA指标提高了5.5%。我们进一步表明,现有的大型多模态模型在生成跨域场景文本捕捉方面存在局限性,而与此相比,我们的VimTS模型所需的参数和数据显著更少。代码和数据集将在https://VimTextSpotter.github.io公开。
引用
@article{arxiv.2404.19652,
title = {VimTS: A Unified Video and Image Text Spotter for Enhancing the Cross-domain Generalization},
author = {Yuliang Liu and Mingxin Huang and Hao Yan and Linger Deng and Weijia Wu and Hao Lu and Chunhua Shen and Lianwen Jin and Xiang Bai},
journal= {arXiv preprint arXiv:2404.19652},
year = {2024}
}