CycleDistill: 使用具有循环提炼的 LLM 框架机器翻译
计算与语言
2025-08-12 v2 人工智能
摘要
大型语言模型 (LLM) 虽然具备零/少样本机器翻译 (MT) 能力,但常常不如基于平行语料训练的专用 MT 系统,这在高质量机器翻译中至关重要。然而,平行语料常常稀缺或不存在于低资源语言。本文提出 CycleDistill,一种利用 LLM 和少样本翻译的引导方法,以获得高质量 MT 系统。CycleDistill 通过零/少样本 MT 从单语语料生成合成平行语料,然后用于微调用于生成该数据的模型以进行 MT。CycleDistill 不需要超过 1-4 个少样本示例的平行语料。在本研究中聚焦于三种印度语言,通过仅依赖单语语料,能够实现高质量机器翻译,平均提升约 20-30 个 chrF 分数。我们还研究了在提炼过程中利用 softmax 激活的效果,观察到对翻译质量有轻微提升。
引用
@article{arxiv.2506.19952,
title = {CycleDistill: Bootstrapping Machine Translation using LLMs with Cyclical Distillation},
author = {Deepon Halder and Thanmay Jayakumar and Raj Dabre},
journal= {arXiv preprint arXiv:2506.19952},
year = {2025}
}