中文

仅使用目标无标签语言数据适配聊天语言模型

计算与语言 2025-10-21 v4 人工智能

摘要

词汇扩展(VE)是通过添加新词元并在目标数据上继续预训练来对大型语言模型(LLM)进行语言适配的事实标准方法。虽然这对于在无标签数据上训练的基础模型有效,但对于通过标注对话数据训练以遵循指令的聊天模型来说,这带来了挑战。直接在目标无标签数据上使用VE适配后者可能会导致聊天能力的遗忘。虽然理想情况下,目标聊天数据对于低资源语言通常不可用或创建成本高昂,而机器翻译的替代方案并不总是有效。为了解决这个问题,先前的工作提出使用同一系列的基础模型和聊天模型。该方法首先在目标无标签数据上使用VE适配基础LLM,然后通过添加从源基础模型和聊天模型之间的权重差导出的聊天向量(CV)将其转换为聊天模型。我们提出了ElChat,一种新的聊天LLM语言适配方法,它直接在目标无标签数据上适配聊天模型,无需基础模型。它通过注入源聊天模型的信息来激发聊天能力。与CV相比,ElChat提供了更稳健和更具竞争力的目标语言和安全性能,同时实现了更优越的英语、聊天和指令遵循能力。

关键词

引用

@article{arxiv.2412.11704,
  title  = {Adapting Chat Language Models Using Only Target Unlabeled Language Data},
  author = {Atsuki Yamaguchi and Terufumi Morishita and Aline Villavicencio and Nikolaos Aletras},
  journal= {arXiv preprint arXiv:2412.11704},
  year   = {2025}
}

备注

Accepted to TMLR