BatchGEMBA:基于批量提示和提示压缩的高效机器翻译评估
计算与语言
2025-03-05 v1
摘要
最近的大型语言模型(LLM)基于的自然语言生成评估主要关注单例提示,导致显著的 token 开销和计算效率低下。在本工作中,我们引入了 BatchGEMBA-MQM 框架,将批量提示与 GEMBA-MQM 指标集成。我们的做法将多个翻译实例聚合到单个提示中,相对于单例提示减少 2-4 倍的 token 使用(取决于批量大小)。此外,我们提出了一种面向批量的提示压缩模型,可实现额外的 13-15% token 减少,同时表现出帮助缓解批量引起的质量下降的能力。在 GPT-4o、GPT-4o-mini、Mistral Small、Phi4 和 CommandR7B 等多个 LLM 以及不同批量大小的评估表明,尽管批量处理通常对质量产生负面影响(但有时并非如此),提示压缩并不会进一步降低质量,某些情况下甚至可恢复质量损失。例如,GPT-4o 在应用压缩后可保留超过 90% 的基准性能,而在未压缩情况下仅为 44.6%。我们计划在 https://github.com/NL2G/batchgemba 上发布代码和训练好的模型,以支持该领域的未来研究。
引用
@article{arxiv.2503.02756,
title = {BatchGEMBA: Token-Efficient Machine Translation Evaluation with Batched Prompting and Prompt Compression},
author = {Daniil Larionov and Steffen Eger},
journal= {arXiv preprint arXiv:2503.02756},
year = {2025}
}