面向自适应机器翻译的大型语言模型微调
计算与语言
2023-12-21 v1 信息检索
摘要
本文介绍了针对自适应机器翻译 (MT) 微调通用大型语言模型 (LLM) Mistral 7B 的结果。微调过程涉及在医疗领域内结合使用零样本和单样本翻译提示。主要目标是增强 Mistral 7B 的实时自适应 MT 能力,使其能够在推理时将翻译调整至所需领域。结果(尤其是西班牙语到英语的 MT)展示了微调后模型的有效性,表明在零样本和单样本翻译场景下质量均有提升,超越了 Mistral 7B 的基线性能。值得注意的是,微调后的 Mistral 在零样本翻译中优于 ChatGPT "gpt-3.5-turbo",同时在单样本翻译质量上达到可比水平。此外,微调后 Mistral 的零样本翻译与 NLLB 3.3B 的性能相当,而其单样本翻译质量则超越了 NLLB 3.3B。这些发现强调了微调像 Mistral 7B 这样高效 LLM 的重要性,以产生可与 NLLB 3.3B 等面向任务的模型相媲美的高质量零样本翻译。此外,在单样本翻译中获得的自适应增益与 ChatGPT 等商业 LLM 相当。我们的实验表明,利用包含混合零样本和单样本提示的 20,000 个片段的相对较小的数据集,微调显著增强了 Mistral 的上下文学习能力,尤其是在实时自适应 MT 方面。
引用
@article{arxiv.2312.12740,
title = {Fine-tuning Large Language Models for Adaptive Machine Translation},
author = {Yasmin Moslem and Rejwanul Haque and Andy Way},
journal= {arXiv preprint arXiv:2312.12740},
year = {2023}
}