中文

为何不将聊天大语言模型转化为非英语?

计算与语言 2025-09-03 v3

摘要

非英语数据的稀缺限制了非英语大语言模型(LLM)的发展。将英语为中心的LLM转化为非英语已被证明是一种有效且资源高效的方法。先前的工作从基础LLM开始,并使用更强LLM(如GPT-4)生成的数据进行知识蒸馏(KD)。与基础LLM相比,聊天LLM进一步优化了高级能力,例如多轮对话和人类偏好对齐,因此在帮助性和安全性方面都更强大。然而,转化聊天LLM涉及两个关键问题:(1)如何在没有监督数据的情况下有效迁移高级能力?(2)如何在转化过程中防止原始知识灾难性遗忘?我们通过引入一个简单框架TransLLM来解决这些问题。对于第一个问题,TransLLM将迁移问题分解为一些常见的子任务,采用翻译思维链,逐步以翻译作为英语和非英语之间的桥梁。我们进一步使用公开数据增强子任务的性能。对于第二个问题,我们提出了一种包含两个协同组件的方法:用于训练的低秩适应以保持原始LLM参数,以及恢复KD,利用聊天LLM自身生成的数据从冻结参数中恢复原始知识。在实验中,我们将LLaMA-2-chat-7B转化为泰语。我们的方法仅使用单轮数据,在多轮基准MT-bench上优于强基线和ChatGPT。此外,我们的方法在没有安全数据的情况下,在安全基准AdvBench上拒绝了比ChatGPT和GPT-4更多的有害查询。代码见https://github.com/hy5468/TransLLM。

关键词

引用

@article{arxiv.2405.13923,
  title  = {Why Not Transform Chat Large Language Models to Non-English?},
  author = {Xiang Geng and Ming Zhu and Jiahuan Li and Zhejian Lai and Wei Zou and Shuaijie She and Jiaxin Guo and Xiaofeng Zhao and Yinglu Li and Yuang Li and Chang Su and Yanqing Zhao and Xinglin Lyu and Min Zhang and Jiajun Chen and Hao Yang and Shujian Huang},
  journal= {arXiv preprint arXiv:2405.13923},
  year   = {2025}
}

备注

The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-025-50646-z}