低资源语言的微调方法
计算与语言
2025-10-07 v1 机器学习
摘要
大语言模型的兴起并未包容所有文化。这些模型主要在英语文本和文化中进行训练,导致在其他语言和文化背景下表现不佳。通过开发一种通用的方法来准备与文化相关的数据集并对Gemma 2模型进行后训练,本项目旨在提高Gemma 2在一种被低估语言上的性能,并展示他人如何同样操作以发掘生成式AI在各自国家和地区的力量以保存其文化遗产。
引用
@article{arxiv.2510.04139,
title = {Fine Tuning Methods for Low-resource Languages},
author = {Tim Bakkenes and Daniel Wang and Anton Johansson},
journal= {arXiv preprint arXiv:2510.04139},
year = {2025}
}