中文

从字节到罗宋汤:针对乌克兰语表征微调Gemma和Mistral

计算与语言 2024-04-16 v1 人工智能 机器学习

摘要

在快速发展的AI和NLP领域,生成式大型语言模型(LLMs)处于创新的前沿,展示了在文本理解和生成方面无与伦比的能力。然而,像乌克兰语这样的低资源语言的有限代表性构成了显著挑战,限制了这项技术的覆盖范围和相关性。我们的论文通过使用乌克兰语数据集微调开源Gemma和Mistral LLMs来解决这个问题,旨在提高它们的语言熟练度,并将它们与其他能够处理乌克兰语的现有模型进行基准测试。这项工作不仅旨在减轻技术中的语言偏见,还促进了数字领域的包容性。我们透明且可重复的方法鼓励进一步的NLP研究和发展。此外,我们提出了乌克兰知识和指令数据集(UKID)以帮助未来语言模型微调的努力。我们的研究不仅推进了NLP领域,还强调了AI中语言多样性的重要性,这对文化保护、教育和扩展AI的全球实用性至关重要。最终,我们倡导一个技术包容的未来,使AI能够有效地用所有语言进行交流,特别是那些目前代表性不足的语言。

关键词

引用

@article{arxiv.2404.09138,
  title  = {From Bytes to Borsch: Fine-Tuning Gemma and Mistral for the Ukrainian Language Representation},
  author = {Artur Kiulian and Anton Polishko and Mykola Khandoga and Oryna Chubych and Jack Connor and Raghav Ravishankar and Adarsh Shirawalmath},
  journal= {arXiv preprint arXiv:2404.09138},
  year   = {2024}
}