用于视频中文本分类的对比图多模态模型
计算机视觉与模式识别
2022-06-07 v1
摘要
视频中文本信息的提取是视频语义理解的关键步骤,通常包含两步:(1)文本识别与(2)文本分类。为了定位视频中的文本,我们可以借助大量基于 OCR 技术的文本识别方法。然而,据我们所知,目前尚无针对视频文本分类这一第二步工作的研究,这将限制对视频索引与浏览等下游任务的指导。在本文中,我们首次通过融合多模态信息来解决这一视频文本分类的新任务,以应对不同类型视频文本可能因各种颜色、未知字体和复杂布局而相互混淆的挑战性场景。此外,我们定制了一个名为 CorrelationNet 的特定模块,通过显式提取布局信息来增强特征表示。进一步地,利用对比学习借助大量无标签视频挖掘样本间的内在联系。最后,我们从新闻领域构建了一个定义良好的新工业数据集,称为 TI-News,专门用于构建和评估视频文本识别与分类应用。在 TI-News 上的大量实验证明了我们方法的有效性。
引用
@article{arxiv.2206.02343,
title = {Contrastive Graph Multimodal Model for Text Classification in Videos},
author = {Ye Liu and Changchong Lu and Chen Lin and Di Yin and Bo Ren},
journal= {arXiv preprint arXiv:2206.02343},
year = {2022}
}