通过专用模型和先进技术增强针对多样文档类型的孟加拉语OCR
计算机视觉与模式识别
2024-02-09 v1 人工智能
机器学习
摘要
本研究论文提出了一种具有某些独特能力的孟加拉语OCR系统。该系统在重建文档布局的同时,能够保留结构、对齐方式和图像。它结合了先进的图像和签名检测技术以实现精确提取。针对不同文档类型(包括计算机排版、凸版印刷、打字机和手写文档)的专用文字分割模型。该系统能够处理静态和动态手写输入,识别各种书写风格。此外,它还具有识别孟加拉语复合字符的能力。广泛的数据收集工作提供了多样化的语料库,而先进的技术组件则优化了字符和单词识别。其他贡献包括图像、标志、签名和表格识别、透视校正、布局重建,以及一个用于高效和可扩展处理的排队模块。该系统在高效、准确的文本提取和分析方面表现出卓越的性能。
引用
@article{arxiv.2402.05158,
title = {Enhancement of Bengali OCR by Specialized Models and Advanced Techniques for Diverse Document Types},
author = {AKM Shahariar Azad Rabby and Hasmot Ali and Md. Majedul Islam and Sheikh Abujar and Fuad Rahman},
journal= {arXiv preprint arXiv:2402.05158},
year = {2024}
}
备注
8 pages, 7 figures, 4 table Link of the paper https://openaccess.thecvf.com/content/WACV2024W/WVLL/html/Rabby_Enhancement_of_Bengali_OCR_by_Specialized_Models_and_Advanced_Techniques_WACVW_2024_paper.html