LANDeRMT:面向机器翻译的语言感知神经元检测与路由框架
计算与语言
2024-10-01 v1
摘要
近期大型语言模型(LLM)的快速发展在有限双语监督数据下展现出在多语言翻译方面的潜在能力。但实际应用中面临两个主要挑战:在提供平行训练数据时进行微调会导致灾难性遗忘和参数干扰。为此,我们提出了LANDeRMT——一个\textbf{L}anguage-\textbf{A}ware \textbf{N}euron \textbf{D}etecting and \textbf{R}outing框架,用于从多样化的翻译训练数据中选择性地微调LLM以实现机器翻译。在LANDeRMT中,我们评估神经元对MT任务的感知能力,并将其分为通用型和特定于语言的神经元。这种分类使我们能够在微调期间对参数进行选择性更新,从而缓解参数干扰和灾难性遗忘的问题。针对检测到的神经元,我们进一步提出了基于条件感知的路由机制,以翻译信号为导向,动态调整LLM中通用型和特定于语言的神经元容量。实验结果表明,所提出的LANDeRMT在学习翻译知识方面效果极佳,显著优于用于多种语言对的各种强基线模型。
引用
@article{arxiv.2409.19523,
title = {LANDeRMT: Detecting and Routing Language-Aware Neurons for Selectively Finetuning LLMs to Machine Translation},
author = {Shaolin Zhu and Leiyu Pan and Bo Li and Deyi Xiong},
journal= {arXiv preprint arXiv:2409.19523},
year = {2024}
}