MURI: 通过逆指令为低资源语言生成高质量指令调优数据集
计算与语言
2024-09-20 v1 人工智能
机器学习
摘要
指令调优通过与人类偏好在各种任务上保持一致来增强大语言模型 (LLM)。传统方法因依赖数据标注,在低资源语言上面临严峻挑战。本工作引入新方法——多语言逆指令 (MURI),无需人工标注员或预训练多语言模型,即可为低资源语言生成高质量指令调优数据集。利用逆指令和翻译管道,MURI 从现有人工编写的低资源语言文本中生成指令-输出对。该方法通过 sourcing 来自不同本土领域的文本并应用过滤器消除不当内容,确保文化相关性和多样性。我们的数据集 MURI-IT 包含超过 200 万条指令-输出对,覆盖 200 种语言。通过本土语言学者评估和 mT5 模型的微调实验,证明该方法对 NLU 和开放式生成都有效。我们公开发布数据集和模型,地址为 https://github.com/akoksal/muri。
引用
@article{arxiv.2409.12958,
title = {MURI: High-Quality Instruction Tuning Datasets for Low-Resource Languages via Reverse Instructions},
author = {Abdullatif Köksal and Marion Thaler and Ayyoob Imani and Ahmet Üstün and Anna Korhonen and Hinrich Schütze},
journal= {arXiv preprint arXiv:2409.12958},
year = {2024}
}