NusaAksara:保护印度尼西亚原住民文字的多模态多语言基准
计算与语言
2025-08-06 v1 人工智能
机器学习
摘要
印度尼西亚拥有丰富的语言和文字。然而,大多数自然语言处理(NLP)的进展都是基于罗马化文本完成的。本文我们提出了 NusaAksara,一个包含原住民文字的新公共基准,涵盖印度尼西亚语言。我们的基准同时覆盖文本和图像模态,包含图像分割、OCR、音译、翻译和语言识别等多样化任务。我们的数据由人工专家通过严谨的步骤构建。NusaAksara 涵盖 7 种语言的 8 种文字,包括在 NLP 基准中不常见的低资源语言。尽管 Lampung 文字不受 Unicode 支持,但仍被纳入该数据集。我们在多个模型上对我们的数据进行了基准测试,包括 GPT-4o、Llama 3.2 和 Aya 23 等 LLM 和 VLM,以及 PP-OCR 和 LangID 等任务特定系统,结果表明大多数 NLP 技术无法处理印度尼西亚的地方文字,许多模型取得了接近零的性能。
引用
@article{arxiv.2502.18148,
title = {NusaAksara: A Multimodal and Multilingual Benchmark for Preserving Indonesian Indigenous Scripts},
author = {Muhammad Farid Adilazuarda and Musa Izzanardi Wijanarko and Lucky Susanto and Khumaisa Nur'aini and Derry Wijaya and Alham Fikri Aji},
journal= {arXiv preprint arXiv:2502.18148},
year = {2025}
}