阿拉伯语后训练数据集综述及其局限性
计算与语言
2025-10-01 v2 人工智能
机器学习
摘要
后训练已成为对齐预训练大型语言模型(LLM)与人类指令的关键技术,显著提升其在广泛任务上的性能。而后训练数据集的质量与多样性正是关键所在。本文综述了在 Hugging Face Hub 上公开可用的阿拉伯语后训练数据集,沿用四个关键维度进行组织:(1) LLM 能力(如问答、翻译、推理、摘要、对话、代码生成和功能调用);(2) 可调性(如人格和系统提示);(3) 对齐性(如文化、安全、伦理和公平性);(4) 鲁棒性。对每个数据集都进行了严格评估,包括流行度、实际采用情况、更新维护情况、文档与标注质量、许可证透明度以及科学贡献。我们的综述发现,阿拉伯语后训练数据集开发中存在关键缺口,包括任务多样性有限、文档与标注不一致或缺失、社区采用率低等问题。最后,本文讨论了这些缺口对阿拉伯语中心 LLM 进展及其应用的影响,同时为未来阿拉伯语后训练数据集开发提供了具体建议。
引用
@article{arxiv.2507.14688,
title = {Mind the Gap: A Review of Arabic Post-Training Datasets and Their Limitations},
author = {Mohammed Alkhowaiter and Norah Alshahrani and Saied Alshahrani and Reem I. Masoud and Alaa Alzahrani and Deema Alnuhait and Emad A. Alghamdi and Khalid Almubarak},
journal= {arXiv preprint arXiv:2507.14688},
year = {2025}
}