DriveThru:面向印尼本地语言档案的文档提取平台与基准数据集
计算与语言
2024-11-18 v2
摘要
印度尼西亚是语言最多样化的国家之一。然而,尽管具有这种语言多样性,印尼语在自然语言处理(NLP)研究和技术中仍然代表性不足。在过去两年中,人们进行了若干努力来构建印尼语的 NLP 资源。然而,这些努力大多集中于创建人工资源,因此难以扩展到更多语言。尽管许多印尼语没有网络存在,但在当地有以书籍、杂志和报纸等印刷形式记录这些语言的资源。将这些现有资源数字化将使印尼语资源构建能够扩展到更多语言。在本文中,我们提出了一种通过文档数字化来创建数据集的替代方法,该方法此前未曾用于在印度尼西亚构建数字语言资源。DriveThru 是一个利用光学字符识别(OCR)技术提取文档内容的平台,旨在以更少的人工工作和成本提供语言资源构建。本文还研究了当前最先进的 LLM 在 OCR 后校正中的实用性,以展示其相比于现成 OCR 提高字符准确率(CAR)和词准确率(WAR)的能力。
引用
@article{arxiv.2411.09318,
title = {DriveThru: a Document Extraction Platform and Benchmark Datasets for Indonesian Local Language Archives},
author = {Mohammad Rifqi Farhansyah and Muhammad Zuhdi Fikri Johari and Afinzaki Amiral and Ayu Purwarianti and Kumara Ari Yuana and Derry Tanti Wijaya},
journal= {arXiv preprint arXiv:2411.09318},
year = {2024}
}
备注
12 pages, 3 figures, 6 tables