基于语义奖励的强化学习实现低资源语言扩展且无对齐税
计算与语言
2026-05-15 v1 机器学习
摘要
将大型语言模型 (LLMs) 扩展到低资源语言通常会产生“对齐税”:目标语言的提升是以通用能力的灾难性遗忘为代价的。我们认为这种权衡源于监督微调 (SFT) 的僵化,它在狭窄且有偏的数据分布上强制执行词元级表面模仿。为了解决这一局限性,我们提出了一种由群体相对策略优化 (GRPO) 驱动的语义空间对齐范式,其中模型使用嵌入级语义奖励而非似然最大化进行优化。该目标通过灵活的实现方式鼓励语义保持,从而实现可控更新,减少对预训练知识的破坏性干扰。我们在藏汉机器翻译和藏文标题生成任务上评估了该方法。实验表明,我们的方法在获取低资源能力的同时显著减轻了对齐税,比 SFT 更有效地保留了通用能力。尽管产生的表面重叠不那么僵化,语义强化学习在开放式生成中产生了更高的语义质量和偏好,且少样本迁移结果表明它在有限监督下学习了更具可迁移性和鲁棒性的表示。总体而言,我们的研究表明,带有语义奖励的强化学习为包容性低资源语言扩展提供了一条更安全、更可靠的途径。
引用
@article{arxiv.2605.14366,
title = {Reinforcement Learning with Semantic Rewards Enables Low-Resource Language Expansion without Alignment Tax},
author = {Zeli Su and Ziyin Zhang and Zhou Liu and Xuexian Song and Zhankai Xu and Longfei Zheng and Xiaolu Zhang and Rong Fu and Guixian Xu and Wentao Zhang},
journal= {arXiv preprint arXiv:2605.14366},
year = {2026}
}
备注
ACL 2026 Findings