跨语言一致性的后训练语言模型
计算与语言
2026-05-29 v3 人工智能
摘要
语言模型常常在不同语言中对等价提示作出不一致的响应,这削弱了多语言系统的可靠性。为量化这一点,我们给出一种信息论定义,将模型响应分布与其在语言之间来回推送的 pushforward 之间的发散界限。我们然后引入了惩罚一致性优化 (PCO),一种后训练程序,将该发散与对固定参考语言模型的 Kullback-Leibler 惩罚耦合。由于直接优化 PCO 需要昂贵的 on-policy roll-outs,我们提出了可可行的替代方案 direct consistency optimization (DCO),可在 off-policy 下进行优化。跨各种语言模型和 26 种语言,DCO 显著提高了跨语言一致性,超越现有方法,并实现了对低资源语言的有针对性的对齐。
引用
@article{arxiv.2603.04678,
title = {Post-Training Language Models for Crosslingual Consistency},
author = {Tianyu Liu and Jirui Qi and Mrinmaya Sachan and Ryan Cotterell and Raquel Fernández and Arianna Bisazza},
journal= {arXiv preprint arXiv:2603.04678},
year = {2026}
}
备注
ICML 2026. The first two authors contributed equally. Codes available at: https://github.com/Betswish/ConsistencyRL