中文

BatchGEMBA:基于批量提示和提示压缩的高效机器翻译评估

计算与语言 2025-03-05 v1

摘要

最近的大型语言模型(LLM)基于的自然语言生成评估主要关注单例提示,导致显著的 token 开销和计算效率低下。在本工作中,我们引入了 BatchGEMBA-MQM 框架,将批量提示与 GEMBA-MQM 指标集成。我们的做法将多个翻译实例聚合到单个提示中,相对于单例提示减少 2-4 倍的 token 使用(取决于批量大小)。此外,我们提出了一种面向批量的提示压缩模型,可实现额外的 13-15% token 减少,同时表现出帮助缓解批量引起的质量下降的能力。在 GPT-4o、GPT-4o-mini、Mistral Small、Phi4 和 CommandR7B 等多个 LLM 以及不同批量大小的评估表明,尽管批量处理通常对质量产生负面影响(但有时并非如此),提示压缩并不会进一步降低质量,某些情况下甚至可恢复质量损失。例如,GPT-4o 在应用压缩后可保留超过 90% 的基准性能,而在未压缩情况下仅为 44.6%。我们计划在 https://github.com/NL2G/batchgemba 上发布代码和训练好的模型,以支持该领域的未来研究。

关键词

引用

@article{arxiv.2503.02756,
  title  = {BatchGEMBA: Token-Efficient Machine Translation Evaluation with Batched Prompting and Prompt Compression},
  author = {Daniil Larionov and Steffen Eger},
  journal= {arXiv preprint arXiv:2503.02756},
  year   = {2025}
}