中文

Vuyko Mistral:为低资源方言翻译适配大语言模型

计算与语言 2025-07-29 v1

摘要

本文介绍了首个为乌克兰方言(本研究中为胡特松方言)适配大语言模型(LLM)的工作,这是一种低资源且形态复杂的方言,位于卡拉帕山高原。我们创建了一个包含 9852 对方言至标准乌克兰句子对的平行语料库,以及 7320 对方言词汇映射的词典。我们还通过提出一种先进的检索增强生成(RAG)管道来解决数据不足问题,将语料库扩展至 52142 个示例。我们使用 LoRA 对多个开源大语言模型进行微调,并在标准译方言翻译任务上进行评估,同时与少量-shot GPT-4o 翻译进行比较。由于缺乏人工标注,我们采用结合 BLEU、chrF++、TER 和基于 LLM 的判断(GPT-4o)的多指标评估策略。结果显示,甚至是规模较小(7B)的微调模型在自动评估和 LLM 评估指标上均超越了零-shot 基线如 GPT-4o。所有数据、模型和代码已公开发布于:https://github.com/woters/vuyko-hutsul

关键词

引用

@article{arxiv.2506.07617,
  title  = {Vuyko Mistral: Adapting LLMs for Low-Resource Dialectal Translation},
  author = {Roman Kyslyi and Yuliia Maksymiuk and Ihor Pysmennyi},
  journal= {arXiv preprint arXiv:2506.07617},
  year   = {2025}
}

备注

Preprint. Will be published at Proceedings of the Fourth Ukrainian Natural Language Processing Workshop (UNLP)