中文

用于信息图解析与摘要的合成训练图标候选框生成

计算机视觉与模式识别 2024-01-01 v1

摘要

信息图广泛应用于新闻、商业与教育媒体,其经手工设计以有效传达关于复杂且常属抽象主题(如“保护环境的方法”与“理解金融危机”)的信息。信息图由风格与语义多样的视觉及文本元素构成,给计算机视觉带来了新挑战。尽管自动文本提取在信息图上表现良好,但基于自然图像训练的计算机视觉方法无法识别信息图中的独立视觉元素(即“图标”)。为弥合这一表征鸿沟,我们提出一种合成数据生成策略:用从 Visually29K 数据集中获取的信息图背景块,叠加互联网抓取的图标,作为图标候选机制的训练数据。在 1K 标注信息图的测试集上,图标定位的精确率为 38%、召回率为 34%(基于自然图像训练的最佳模型精确率 14%、召回率 7%)。将我们的图标候选与图标分类及文本提取相结合,我们给出了一个多模态摘要应用。该应用以信息图为输入,自动生成文本标签与视觉标签(hashtags),分别文本式与视觉式地代表信息图的主题。

关键词

引用

@article{arxiv.1807.10441,
  title  = {Synthetically Trained Icon Proposals for Parsing and Summarizing Infographics},
  author = {Spandan Madan and Zoya Bylinskii and Matthew Tancik and Adrià Recasens and Kimberli Zhong and Sami Alsheikh and Hanspeter Pfister and Aude Oliva and Fredo Durand},
  journal= {arXiv preprint arXiv:1807.10441},
  year   = {2024}
}