与不流畅评判器的流畅对齐:低资源语言的后训练
计算与语言
2026-03-30 v2 人工智能
摘要
我们提出一种面向低资源语言的后训练方法,该方法即使在由不流畅奖励模型对齐的情况下也能保持语言模型的流利度。偏好优化目前是一个研究充分的主题,但先前的工作主要针对英语和中文模型。低资源语言既缺乏母语者编写的数据集,也缺乏能够生成流畅合成数据的指令微调语言模型。为了解决这一问题,我们专注于在不依赖目标语言任何指令微调数据的情况下开发流畅的偏好对齐语言模型。我们的方法采用策略内训练方法,我们将其与两种常见替代方案进行了比较:基于机器翻译数据的监督微调和多语言微调。我们以挪威博克马尔语为案例研究,并通过母语者评估来衡量流利度。结果表明策略内训练的方面至关重要,且在不依赖任何难以获取的数据的情况下优于替代方案。
引用
@article{arxiv.2512.08777,
title = {Fluent Alignment with Disfluent Judges: Post-training for Lower-resource Languages},
author = {David Samuel and Lilja Øvrelid and Erik Velldal and Andrey Kutuzov},
journal= {arXiv preprint arXiv:2512.08777},
year = {2026}
}