中文

SmolKalam:面向高质量阿拉伯语后训练数据的集成质量过滤翻译

计算与语言 2025-11-25 v1 人工智能

摘要

尽管社区已致力于获取高质量阿拉伯语 pretraining 数据,但我们仍缺乏包含推理和工具调用的大规模、多轮阿拉伯语数据集。粗糙的翻译在 pretraining 规模下可行,但 post-training 对数据质量要求更高,这需要更严格的数据修剪方法。在本工作中,我们介绍了 SmolKalam,这是一种将 Smoltalk2 翻译为阿拉伯语的方法,采用多模型集成翻译管线,应用质量过滤,并通过消除实验检验传统 decoder-only 模型的有效翻译技术。

关键词

引用

@article{arxiv.2511.18411,
  title  = {SmolKalam: Ensemble Quality-Filtered Translation at Scale for High Quality Arabic Post-Training Data},
  author = {Sultan Alrashed and Chadi Helwe and Francesco Orabona},
  journal= {arXiv preprint arXiv:2511.18411},
  year   = {2025}
}

备注

Work in progress