面向低资源目标语言生成的源语言 grounding 语义强化学习
计算与语言
2026-05-29 v1 人工智能
摘要
低资源目标语言生成常受限于稀缺的平行数据,而高资源源语言单语数据丰富但难以用于标准监督微调。我们提出 Source-Grounded Semantic Reinforcement Learning (SG-SRL),一种资源利用框架,将源语言单语数据转换为面向目标语言生成的跨语言语义监督。SG-SRL 对源语言数据执行无参考强化学习 (RL),采用基于跨语言重排序器的跨语言语义奖励模型,该模型对源输入与目标语言生成之间的语义相关性进行评分。虽然这会导致严重的冗长性奖励作弊,我们采用轻量级恢复阶段结合小型平行语料库来恢复流畅性、简洁性和任务格式,同时保持语义收益。在中文到泰语生成任务上,SG-SRL 在语义 grounding 和事实覆盖方面优于 cold-start SFT。额外分析表明,SG-SRL 在长篇迁移和藏语嵌入式奖励方面的泛化行为,显示出基于编码器的语义奖励可在现实的低资源语言环境中替代 LLM-based 重排序器。
关键词
引用
@article{arxiv.2605.29502,
title = {Source-Grounded Semantic Reinforcement Learning for Low-Resource Target-Language Generation},
author = {Zeli Su and Ziyin Zhang and Zewei Pan and Zhou Liu and Dingcheng Huang and Dehan Li and Zhankai Xu and Longfei Zheng and Xiaolu Zhang and Jun Zhou and Wentao Zhang},
journal= {arXiv preprint arXiv:2605.29502},
year = {2026}
}