基于对比偏好优化的数据高效领域适应 LLM 基于 MT 的方法
计算与语言
2025-11-03 v1
摘要
大型语言模型(LLM)通常需要适应特定领域的要求,而仅依赖 SFT 的适应过程可能代价高昂。 我们对将 CPO 应用于数据高效领域适应进行了实证研究,以模拟后编辑工作流程。 我们的方法通过将基础模型的原始输出视为“被拒绝”的翻译,将人类批准的 TM 条目视为“被选中”的翻译,从而合成偏好对。 该方法对模型当前知识提供直接反馈,引导其符合特定领域的标准。 在英巴西葡萄牙语和英韩语实验中,我们仅使用 14.7k 个偏好对,即可获得相当于使用 160k+ 样本进行 SFT 训练的模型性能,显示出显著的数据效率。 虽然我们在机器翻译中展示了其有效性,但该 CPO 方法的应用天然地推广到其他生成任务,即那些模型初始草稿可作为对黄金参考的对比信号的任务。
引用
@article{arxiv.2510.27556,
title = {Data-Efficient Domain Adaptation for LLM-based MT using Contrastive Preference Optimization},
author = {Inacio Vieira and Antonio Castaldo and James O'Doherty and Sheila Castilho},
journal= {arXiv preprint arXiv:2510.27556},
year = {2025}
}