通过模型编辑缓解 LLM 基于机器翻译中的语言不匹配与重复问题
计算与语言
2024-10-10 v1 机器学习
摘要
大语言模型(LLM)最近在自然语言处理领域取得了突破,但在某些特定下游任务中仍表现不足。本文聚焦于利用 LLM 进行机器翻译,观察到两种错误模式频繁发生且严重影响翻译质量:语言不匹配和重复。工作旨在通过利用模型编辑方法(例如,通过定位负责这些错误的前馈网络(FFN)神经元或其他组件并在推理时停用它们)来缓解这两个问题。我们发现,直接应用此类方法要么对目标错误效果有限,要么对整体翻译质量产生显著负面副作用,表明所定位的组件可能也是确保 LLM 在机器翻译中顺利运行的关键。为此,我们提出通过在不同语言设置下获取定位结果的交集来细化这些组件,筛选出与目标错误无关的信息。实验结果经验性地表明,我们的方法能够有效降低语言不匹配和重复比率,同时在大多数情况下提升或保持整体翻译质量。
引用
@article{arxiv.2410.07054,
title = {Mitigating the Language Mismatch and Repetition Issues in LLM-based Machine Translation via Model Editing},
author = {Weichuan Wang and Zhaoyi Li and Defu Lian and Chen Ma and Linqi Song and Ying Wei},
journal= {arXiv preprint arXiv:2410.07054},
year = {2024}
}
备注
20 pages, EMNLP'2024 Main Conference