MOoSE:用于开放场景文本识别的多方向共享专家
计算机视觉与模式识别
2024-07-29 v1
摘要
开放集文本识别旨在解决新字符与已见字符的双重挑战,是文本识别领域的兴趣子主题之一。然而,当前的开放集文本识别解决方案仅关注水平文本,无法建模现实场景文本中多种书写方向所带来的实际挑战。多方向文本识别面临图像宽高比多样、数据量显著不平衡以及不同方向之间存在的领域差距等挑战。本文首先提出了多方向开放集文本识别任务(MOOSTR),以建模新字符和书写方向多样性的挑战。随后,我们提出了多方向共享专家(MOoSE)框架作为强大的基线解决方案。MOoSE采用混合专家方案以缓解不同方向之间的领域差距,同时利用专家之间共享的常见结构知识以缓解部分专家面临的数据稀缺问题。通过消融实验验证了所提出MOoSE框架的有效性,并在现有开放集基准测试上进行了可行性测试。代码、模型和文档均可在 https://github.com/lancercat/Moose/ 获取。
引用
@article{arxiv.2407.18616,
title = {MOoSE: Multi-Orientation Sharing Experts for Open-set Scene Text Recognition},
author = {Chang Liu and Simon Corbillé and Elisa H Barney Smith},
journal= {arXiv preprint arXiv:2407.18616},
year = {2024}
}
备注
Accepted in ICDAR2024