中文

ATHAR:面向古典阿拉伯语到英语翻译的高质量多样数据集

计算与语言 2025-09-08 v2 人工智能

摘要

古典阿拉伯语代表了一个重要的时代,涵盖了阿拉伯文化、哲学和科学文献的黄金时期。随着大语言模型(LLMs)和翻译系统的兴起,为这些文献翻译以促进跨社区知识传播显得尤为重要。然而,我们注意到古典阿拉伯语的翻译数据集稀缺且常受限于范围和主题,阻碍了高质量翻译系统的发展。为此,我们提出了 ATHAR 数据集,包含 66,000 组高质量的古典阿拉伯语到英语翻译样本,涵盖科学、文化和哲学等广泛主题。此外,我们评估了当前最先进的大语言模型在不同设置下的性能,得出结论,这些数据集在当前系统中仍有必要。我们的发现表明,模型可以通过微调或纳入预训练管道中来从中受益。该数据集已公开发布在 HuggingFace 数据中心:https://huggingface.co/datasets/mohamed-khalil/ATHAR。

关键词

引用

@article{arxiv.2407.19835,
  title  = {ATHAR: A High-Quality and Diverse Dataset for Classical Arabic to English Translation},
  author = {Mohammed Khalil and Mohammed Sabry},
  journal= {arXiv preprint arXiv:2407.19835},
  year   = {2025}
}

备注

ArabicNLP 2025