从历史文字到现代视觉:面向 Modi 文本至 Devanagari 音译的新型数据集与 VLM 框架
计算机视觉与模式识别
2025-03-26 v2
摘要
在中世纪的印度,马拉地语使用 Modi 文字书写。用 Modi 文字书写的文本包含了关于中世纪科学、医学、土地记录以及印度历史真实证据的丰富知识。大约有 4000 万份文件状况不佳且尚未被音译。此外,该领域只有少数专家能将这种文字音译为英文或 Devanagari。过去的大多数研究主要集中在单个字符识别上。需要一个能够将 Modi 文字文件音译为 Devanagari 文字的系统。我们提出了 MoDeTrans 数据集,包含 2,043 张 Modi 文字文件图像及其对应的 Devanagari 文本音译。我们进一步引入了 MoScNet(\textbf{Mo}di \textbf{Sc}ript \textbf{Net}work),这是一种新颖的视觉-语言模型(VLM)框架,用于将 Modi 文字图像音译为 Devanagari 文本。MoScNet 利用知识蒸馏,由学生模型向教师模型学习以增强音译性能。MoScNet 的最终学生模型在参数量减少 163 的情况下,性能优于教师模型。我们的工作是首个实现从手写 Modi 文字到 Devanagari 文字直接音译的研究。MoScNet 在光学字符识别(OCR)任务上也展现出了有竞争力的结果。
引用
@article{arxiv.2503.13060,
title = {Historic Scripts to Modern Vision: A Novel Dataset and A VLM Framework for Transliteration of Modi Script to Devanagari},
author = {Harshal Kausadikar and Tanvi Kale and Onkar Susladkar and Sparsh Mittal},
journal= {arXiv preprint arXiv:2503.13060},
year = {2025}
}
备注
Under submission at a conference