UniMERNet:面向真实世界数学公式识别的通用网络
计算机视觉与模式识别
2024-09-06 v2
摘要
本文引入了 UniMER 数据集,标志着首次针对复杂真实世界场景的数学公式识别(MER)研究。UniMER 数据集包含大规模训练集 UniMER-1M,其提供了一百万个训练实例,具有前所未有的规模和多样性,用于训练高质量、鲁棒的模型。此外,UniMER 还包含一个精心设计的多样化测试集 UniMER-Test,涵盖了真实世界场景中的各种公式分布,提供了更全面和公平的评估。为了更好地利用 UniMER 数据集,本文提出了一种通用数学公式识别网络(UniMERNet),针对公式识别的特点进行了专门设计。UniMERNet 由一个融合了细节感知和局部上下文特征的精心设计的编码器,以及一个用于加速性能的优化解码器组成。使用 UniMER-1M 数据集和 UniMERNet 进行的大量实验表明,在大规模 UniMER-1M 数据集上进行训练可以产生更具泛化能力的公式识别模型,显著优于以往所有数据集。此外,UniMERNet 的引入提升了模型在公式识别中的性能,实现了更高的准确率和速度。所有数据、模型和代码均可在 https://github.com/opendatalab/UniMERNet 获取。
引用
@article{arxiv.2404.15254,
title = {UniMERNet: A Universal Network for Real-World Mathematical Expression Recognition},
author = {Bin Wang and Zhuangcheng Gu and Guang Liang and Chao Xu and Bo Zhang and Botian Shi and Conghui He},
journal= {arXiv preprint arXiv:2404.15254},
year = {2024}
}
备注
Project Website: https://github.com/opendatalab/UniMERNet