高效翻译推理中的迭代层剪枝
计算与语言
2025-10-28 v1 性能
摘要
大型语言模型(LLMs)已在自然语言处理的许多领域取得变革性进展,包括机器翻译。然而,由于其计算需求强烈,LLMs的高效部署仍具有挑战性。本文针对这一挑战,提出了我们在机器翻译会议(WMT 2025)模型压缩轨道中的提交。在实验中,我们探索了受层重要性分析指导的迭代层剪枝方法。我们使用Aya-Expanse-8B模型,对来自捷克到德语以及英语到埃及阿拉伯语的翻译进行评估。我们的方法在显著减少模型规模和推理时间的同时,保持了基线模型的翻译质量。
引用
@article{arxiv.2510.22763,
title = {Iterative Layer Pruning for Efficient Translation Inference},
author = {Yasmin Moslem and Muhammad Hazim Al Farouq and John D. Kelleher},
journal= {arXiv preprint arXiv:2510.22763},
year = {2025}
}
备注
WMT 2025