LuxInstruct:面向卢森堡语的跨语言指令调优数据集
计算与语言
2025-10-09 v1 人工智能
摘要
指令调优已成为增强大语言模型性能的关键技术,使其能够更好地遵循人类指令。然而,诸如卢森堡语等低资源语言因缺乏高质量指令数据集而面临严峻挑战。传统依赖机器翻译往往会引入语义错位和文化不准确的问题。本文通过构建一个面向卢森堡语的跨语言指令调优数据集来应对这些挑战,完全不依赖将机器翻译转化为卢森堡语。相反,我们利用来自英语、法语和德语的对齐数据,构建一个保留语言和文化细微差别的高质量数据集。我们提供证据表明,跨语言指令调优不仅改善了跨语言的表示对齐,还提升了模型在卢森堡语中的生成能力。这凸显了跨语言数据 curated 方法如何规避机器翻译数据的常见陷阱,直接促进低资源语言发展。
引用
@article{arxiv.2510.07074,
title = {LuxInstruct: A Cross-Lingual Instruction Tuning Dataset For Luxembourgish},
author = {Fred Philippy and Laura Bernardy and Siwen Guo and Jacques Klein and Tegawendé F. Bissyandé},
journal= {arXiv preprint arXiv:2510.07074},
year = {2025}
}
备注
Paper under review; Dataset available at https://huggingface.co/datasets/fredxlpy/LuxInstruct