通过增强指令提升大语言模型的翻译忠实度
计算与语言
2023-08-25 v1 人工智能
摘要
大语言模型(LLMs)展现出强大的通用能力,当前一个引人关注的挑战是通过低成本的指令微调激发其专用能力,如机器翻译。标准指令跟随数据按顺序组织为指令、输入和回复的拼接。由于LLMs的注意力机制在局部聚焦上存在局限,模型在每个位置往往更关注邻近的词语或句子,这导致解码过程中指令遗忘的高风险。为缓解上述问题,我们提出SWIE(分段加权指令嵌入)和指令跟随数据集OVERMISS。SWIE通过在后续输入和回复表示上添加全局指令表示来改进模型的指令理解。OVERMISS通过将过翻译和漏翻译结果与正确翻译进行对比来提升模型忠实度。我们将方法应用于两个主流开源LLM:BLOOM和LLaMA。实验结果表明,基于BLOOMZ-3b的SWIE在翻译性能上显著提升,尤其在零样本和长文本翻译中因指令遗忘风险降低而改善明显。此外,OVERMISS在翻译性能上优于基线(例如LLaMA-7b的BLEU分数从0.69提升至3.12,基于词对齐的comet分数平均提升0.48个百分点),结合OVERMISS与SWIE的模型进一步提升(例如在英语到德语翻译中,三种不同骨干网络的BLUE分数最高提升0.56),且两者在基于词对齐的忠实度指标上均有改进。
引用
@article{arxiv.2308.12674,
title = {Improving Translation Faithfulness of Large Language Models via Augmenting Instructions},
author = {Yijie Chen and Yijin Liu and Fandong Meng and Yufeng Chen and Jinan Xu and Jie Zhou},
journal= {arXiv preprint arXiv:2308.12674},
year = {2023}
}
备注
Our code and datasets are released in Github: https://github.com/pppa2019/swie_overmiss_llm4mt