看清司法:基于 OCR 和视觉语言模型的手写法律文件翻译
计算机视觉与模式识别
2025-12-23 v1 人工智能
计算与语言
机器学习
摘要
手写文本识别 (HTR) 和机器翻译仍然是低资源语言(如马拉athi)面临的重大挑战,这些语言缺乏大规模数字化语料库,并且手写体样式高度可变。传统方法是使用两个阶段管道:OCR 系统从手写图像中提取文本,然后使用机器翻译模型将其翻译成目标语言。在本工作中,我们探索并比较了传统 OCR-MT 管道与视觉大语言模型的性能,后者旨在统一这些阶段,并以单一、端到端的方式直接翻译手写文本图像。我们的动机来自于迫切需要可扩展、准确的翻译系统来数字化印度地区和高等法院的法律记录,如 FIR、起诉书和证人陈述。在本文中,我们在手写马拉athi 法律文件上构建的精选数据集上评估了两种方法,目标是即使在低资源环境中也能高效地处理法律文件。我们的发现为构建稳健、可部署到边缘的解决方案提供了可操作的见解,这些解决方案将提高非母语者和法律专业人员获取法律信息的便利性。
引用
@article{arxiv.2512.18004,
title = {Seeing Justice Clearly: Handwritten Legal Document Translation with OCR and Vision-Language Models},
author = {Shubham Kumar Nigam and Parjanya Aditya Shukla and Noel Shallum and Arnab Bhattacharya},
journal= {arXiv preprint arXiv:2512.18004},
year = {2025}
}
备注
Accepted in AILaw @ AAAI 2026 Conference