SmolKalam:面向高质量阿拉伯语后训练数据的集成质量过滤翻译
计算与语言
2025-11-25 v1 人工智能
摘要
尽管社区已致力于获取高质量阿拉伯语 pretraining 数据,但我们仍缺乏包含推理和工具调用的大规模、多轮阿拉伯语数据集。粗糙的翻译在 pretraining 规模下可行,但 post-training 对数据质量要求更高,这需要更严格的数据修剪方法。在本工作中,我们介绍了 SmolKalam,这是一种将 Smoltalk2 翻译为阿拉伯语的方法,采用多模型集成翻译管线,应用质量过滤,并通过消除实验检验传统 decoder-only 模型的有效翻译技术。
引用
@article{arxiv.2511.18411,
title = {SmolKalam: Ensemble Quality-Filtered Translation at Scale for High Quality Arabic Post-Training Data},
author = {Sultan Alrashed and Chadi Helwe and Francesco Orabona},
journal= {arXiv preprint arXiv:2511.18411},
year = {2025}
}
备注
Work in progress