翻译准确性的隐藏成本: 蒸馏、量化与环境影响
计算与语言
2025-10-03 v2 人工智能
摘要
大型语言模型(LLM)的快速扩张加剧了对其计算和环境成本的关注。本研究通过将机器翻译作为案例研究,探讨了翻译质量与效率之间的权衡,比较了全规模、蒸馏和量化模型。我们在Flores+基准上评估了性能,并通过对法语、印地语和 Kannada 对话翻译的人类判断进行了评估。我们的分析显示,全3.3B FP32模型虽取得最高的BLEU分数,但产生最大的环境足迹(~ 0.007-0.008 kg CO2/次)。蒸馏600M FP32模型相较于全模型将推理时间缩短71-78%,碳排放减少63-65%,仅有轻微的BLEU分数下降。人类评估进一步表明,即使是激进的量化(INT4)也能保持高水平的准确性和流畅性,不同模型之间的差异通常很小。这些发现表明,模型压缩策略可显著降低计算需求和环境影响,同时保持具竞争力的翻译质量,尽管在低资源设置下权衡更为明显。我们主张将效率和可持续性纳入评估框架的核心维度,与准确性一起作为NLP 进步的关键维度。
引用
@article{arxiv.2509.23990,
title = {The Hidden Costs of Translation Accuracy: Distillation, Quantization, and Environmental Impact},
author = {Dhaathri Vijay and Anandaswarup Vadapalli},
journal= {arXiv preprint arXiv:2509.23990},
year = {2025}
}