中文

低资源语言的微调方法

计算与语言 2025-10-07 v1 机器学习

摘要

大语言模型的兴起并未包容所有文化。这些模型主要在英语文本和文化中进行训练,导致在其他语言和文化背景下表现不佳。通过开发一种通用的方法来准备与文化相关的数据集并对Gemma 2模型进行后训练,本项目旨在提高Gemma 2在一种被低估语言上的性能,并展示他人如何同样操作以发掘生成式AI在各自国家和地区的力量以保存其文化遗产。

关键词

引用

@article{arxiv.2510.04139,
  title  = {Fine Tuning Methods for Low-resource Languages},
  author = {Tim Bakkenes and Daniel Wang and Anton Johansson},
  journal= {arXiv preprint arXiv:2510.04139},
  year   = {2025}
}