中文

基于聚光机制从结构图像转录内容

机器学习 2019-05-28 v1 计算机视觉与模式识别 声音 机器学习

摘要

从结构图像中转录内容(例如从乐谱中记录音符)是一项具有挑战性的任务,因为不仅需要识别内容对象,还必须保留内部结构。现有的图像识别方法主要处理内容简单的图像(例如带字符的文本行),但无法识别内容更复杂(例如结构化符号)的图像,这类图像通常遵循细粒度的语法。为此,本文提出一种分层的聚光转录网络(STN)框架,采用两阶段“何处看-写什么”方案。具体而言,我们首先通过一种新颖的聚光机制决定“何处看”,依据原始图像的结构聚焦于不同区域。然后,我们通过构建基于 GRU 的网络并利用聚光区域来决定“写什么”,从而相应地转录内容。此外,我们基于 STN 提出两种实现,即 STNM 和 STNR,其聚光移动分别遵循马尔可夫性质和循环建模。我们还设计了一种强化方法来通过自我改进聚光机制以精炼框架。我们在多个结构图像数据集上进行了大量实验,结果清楚地展示了 STN 框架的有效性。

关键词

引用

@article{arxiv.1905.10954,
  title  = {Transcribing Content from Structural Images with Spotlight Mechanism},
  author = {Yu Yin and Zhenya Huang and Enhong Chen and Qi Liu and Fuzheng Zhang and Xing Xie and Guoping Hu},
  journal= {arXiv preprint arXiv:1905.10954},
  year   = {2019}
}

备注

Accepted by KDD2018 Research Track. In proceedings of the 24th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD'18)