搭建博斯波路斯:通过低资源语言适应与基准测试策略推进土耳其大型语言模型
计算与语言
2024-05-09 v1 人工智能
机器学习
摘要
大型语言模型(LLM)正在成为各领域的关键技术,对 underrepresented 语言(如土耳其语)的高质量模型迫切需求日益增长。本文探讨了面对低资源语言(如数据稀缺、模型选择、评估和计算限制)所固有的独特挑战,特别聚焦土耳其语。我们对训练策略、模型选择和数据可得性对面向底层语言设计的 LLM 性能产生的影响进行深入分析。我们的ethods 包括两种方法:(i)改造最初预训练于英语的现有 LLM 以理解土耳其语,(ii)使用土耳其语预训练数据从零开发模型,两者均辅以针对增强推理能力的 novel 土耳其指令微调数据集进行监督式微调。我们创建了一个新的土耳其 LLM 排行榜,包含评估不同推理和知识技能的基准测试,以评估这些方法的相对性能。此外,我们在预训练和微调期间开展了数据规模和模型规模的实验,同时强调跨语言知识迁移的能力,并解决在不同语言上的微调中遇到的灾难性遗忘挑战。我们的目标是为在低资源语言情境下推进 LLM 框架提供详细指南,从而使自然语言处理(NLP)的益处更易于全球获取。
引用
@article{arxiv.2405.04685,
title = {Bridging the Bosphorus: Advancing Turkish Large Language Models through Strategies for Low-Resource Language Adaptation and Benchmarking},
author = {Emre Can Acikgoz and Mete Erdogan and Deniz Yuret},
journal= {arXiv preprint arXiv:2405.04685},
year = {2024}
}