CoMER:为基于Transformer的手写数学表达式识别建模覆盖信息
计算机视觉与模式识别
2022-07-19 v2
摘要
基于Transformer的编码器-解码器架构近期在识别手写数学表达式方面取得显著进展。然而,Transformer模型仍受缺乏覆盖信息问题困扰,使其表达式识别率(ExpRate)逊于其RNN对应模型。记录过去步骤对齐信息的覆盖信息,已在RNN模型中证明有效。本文中,我们提出CoMER,一种在Transformer解码器中采用覆盖信息的模型。具体而言,我们提出一种新颖的注意力精炼模块(ARM),利用过去对齐信息精炼注意力权重而不损害其并行性。此外,我们将覆盖信息推向极致,提出自覆盖与交叉覆盖,其利用来自当前层与前层的过去对齐信息。实验表明,与当前最先进(SOTA)模型相比,CoMER在CROHME 2014/2016/2019测试集上分别将ExpRate提升0.61%/2.09%/1.59%,并达到59.33%/59.81%/62.97%。
引用
@article{arxiv.2207.04410,
title = {CoMER: Modeling Coverage for Transformer-based Handwritten Mathematical Expression Recognition},
author = {Wenqi Zhao and Liangcai Gao},
journal= {arXiv preprint arXiv:2207.04410},
year = {2022}
}
备注
Accept by ECCV 2022