Qomhra:一款双语爱尔兰语和英语大语言模型
计算与语言
2026-01-09 v4
摘要
大语言模型(LLM)研究与开发主要聚焦于世界主要语言,导致低资源语言如爱尔兰语 underrepresented。本文介绍\textbf{Qomhr\'a},这是一种双语爱尔兰语和英语大语言模型,在极端低资源约束下开发。概述了完整的管道,涵盖双语继续预训练、指令微调以及合成人类偏好数据用于未来对齐训练。我们关注缺乏可扩展方法来创建人类偏好数据,通过提出一种新方法合成此类数据,即让LLM生成“被采纳”和“被拒绝”的响应,我们验证了这些响应与L1爱尔兰语说话者的一致性。为选择用于合成的LLM,我们评估了顶级封闭权重LLMs在爱尔兰语生成性能方面的表现。Gemini-2.5-Pro在L1和L2爱尔兰语说话者中排名最高,与LLM作为评判家的评估结果不同,表明当前LLM与爱尔兰语社区之间存在偏差。随后,我们利用Gemini-2.5-Pro将大规模英语指令微调数据集翻译成爱尔兰语,并合成首个爱尔兰语人类偏好数据集。我们全面评估了Qomhr\'a在多个基准测试中的表现,测试翻译、性别理解、主题识别和世界知识;这些评估显示在爱尔兰语和英语方面分别较现有开源爱尔兰语LLM基线UCCIX提升了最高可达29%和44%。本文的结果为开发爱尔兰语及其他低资源语言的LLM提供了见解和指导。
引用
@article{arxiv.2510.17652,
title = {Qomhra: A Bilingual Irish and English Large Language Model},
author = {Joseph McInerney and Khanh-Tung Tran and Liam Lonergan and Ailbhe Ní Chasaide and Neasa Ní Chiaráin and Barry Devereux},
journal= {arXiv preprint arXiv:2510.17652},
year = {2026}
}