利用语料库元数据检测基于模板的翻译:埃及阿拉伯语维基百科版本的探索性案例研究
计算与语言
2024-04-02 v1
摘要
维基百科条目(内容页面)是自然语言处理(NLP)研究中常用的语料库,尤其是在英语以外的低资源语言中。然而,已有少数研究考察了三个阿拉伯语维基百科版本,即阿拉伯语维基百科(AR)、埃及阿拉伯语维基百科(ARZ)和摩洛哥阿拉伯语维基百科(ARY),并记录了埃及阿拉伯语维基百科版本中存在的问题:其大量条目是使用基于模板的翻译从英语自动翻译为阿拉伯语而生成的,无需人工参与,导致埃及阿拉伯语维基百科充斥着不仅内容低劣,而且不能代表埃及人民、其文化和方言的条目。在本文中,我们旨在通过探索性分析识别这些基于模板翻译的条目及其特征,并构建自动检测系统,以缓解埃及阿拉伯语维基百科中出现的模板翻译问题。我们首先从密度、质量和人工贡献方面探索了三个阿拉伯语维基百科版本的内容,并利用所得见解构建了利用条目元数据自动检测模板翻译条目的多元机器学习分类器。随后,我们将性能最佳的分类器 XGBoost 作为名为 EGYPTIAN WIKIPEDIA SCANNER 的在线应用程序公开发布并托管,并向研究社区发布提取、过滤和标注的数据集,以使研究社区受益于我们的数据集和基于网页的在线检测系统。
引用
@article{arxiv.2404.00565,
title = {Leveraging Corpus Metadata to Detect Template-based Translation: An Exploratory Case Study of the Egyptian Arabic Wikipedia Edition},
author = {Saied Alshahrani and Hesham Haroon and Ali Elfilali and Mariama Njie and Jeanna Matthews},
journal= {arXiv preprint arXiv:2404.00565},
year = {2024}
}
备注
This paper has been accepted at LREC-COLING 2024: The 6th Workshop on Open-Source Arabic Corpora and Processing Tools (OSACT6)