中文

如何可以更小?面向设备的紧凑型语言模型用于机器翻译中的关键错误检测

计算与语言 2025-11-14 v1 人工智能

摘要

大型语言模型(LLM)在评估机器翻译(MT)方面表现优异,但其规模和成本阻碍在边缘设备上部署以及隐私敏感工作流程的实现。我们提出问题:在仍能检测到改变意义的翻译错误的前提下,规模可以多小?本文聚焦于English->German关键错误检测(CED),对sub-2B模型(LFM2-350M、Qwen-3-0.6B/1.7B、Llama-3.2-1B-Instruct、Gemma-3-1B)在WMT21、WMT22和SynCED-EnDe-2025上的性能进行基准测试。我们的框架标准化了提示词,应用轻量级logit偏差校准和多数投票,并报告语义质量(MCC、F1-ERR/F1-NOT)和计算指标(VRAM、延迟、吞吐量)。结果显示,约10亿参数是一个清晰的 sweet spot:Gemma-3-1B在经过merged-weights微调后,在SynCED-EnDe-2025上达到MCC=0.77和F1-ERR=0.98,同时保持MacBook Pro M4 Pro(24GB)上单样本400毫秒的延迟。规模更大时,Qwen-3-1.7B获得最高的绝对MCC(比Gemma高0.11),但计算成本更高。相比,超小型模型(0.6B)在少量样本校准下仍可用,但未能检测到实体和数字错误。总体而言,紧凑的、经过指令微调的LLM可通过轻量级校准和小样本监督,为机器翻译提供可靠的、面向设备的CED,从而在实际翻译管道中实现私有、低成本的错误筛查。所有数据集、提示词和脚本均在我们的GitHub仓库中公开。

关键词

引用

@article{arxiv.2511.09748,
  title  = {How Small Can You Go? Compact Language Models for On-Device Critical Error Detection in Machine Translation},
  author = {Muskaan Chopra and Lorenz Sparrenberg and Sarthak Khanna and Rafet Sifa},
  journal= {arXiv preprint arXiv:2511.09748},
  year   = {2025}
}

备注

Accepted in IEEE BigData 2025