中文

基于图像的字符识别与碑文解码文献系统:以神庙铭文为例

计算机视觉与模式识别 2024-05-29 v1 人工智能 机器学习

摘要

本项目对应用于 Brihadeeswarar 神庙墙壁上发现的 10 世纪古泰米尔语铭文的光学字符识别(OCR)方法进行了训练与分析。所选 OCR 方法包括被广泛使用的 OCR 引擎 Tesseract,其采用现代 ICR 技术对原始数据进行预处理,并使用框编辑软件对模型进行微调。对 Tesseract 的分析旨在评估其在准确解读古泰米尔文字符细节方面的有效性。模型在该数据集上的性能由其准确率决定,其中评估数据集被划分为训练集和测试集。通过应对该文字历史背景所带来的独特挑战,本研究旨在为更广泛的 OCR 领域提供有价值的见解,从而促进对古代铭文的更好保护与解读。

关键词

引用

@article{arxiv.2405.17449,
  title  = {Image Based Character Recognition, Documentation System To Decode Inscription From Temple},
  author = {Velmathi G and Shangavelan M and Harish D and Krithikshun M S},
  journal= {arXiv preprint arXiv:2405.17449},
  year   = {2024}
}

备注

This research paper is a part of capstone project submitted to VIT Chennai, VIT University