中文

EffEval:机器翻译评估指标效率的综合评测

计算与语言 2023-11-01 v2 机器学习

摘要

效率是促进包容性和降低环境成本的关键属性,尤其在 LLM 时代。本工作中,我们对机器翻译(MT)评估指标的效率进行了综合评测。我们的方法包括用更轻量的替代方案替换计算密集的 transformer,并在 LLM 表示之上采用线性和二次近似的对齐算法。我们在三个 MT 数据集上评估了六种(无参考和基于参考的)指标,并考察了 16 种轻量 transformer。此外,我们通过使用适配器考察了 COMET 等指标的训练效率。我们的结果表明:(a) TinyBERT 在质量与效率间提供最优平衡;(b) CPU 上的加速比 GPU 上更显著;(c) WMD 近似未带来效率提升反而降低质量;(d) 适配器提升了训练效率(关于反向传播速度与内存需求),且在某些情况下提升了指标质量。这些发现有助于在评估速度与质量间取得平衡,这对有效的 NLG 系统至关重要。此外,我们的研究为以最小性能影响优化 NLG 评估指标的持续努力做出贡献。据我们所知,这是迄今对 MT 指标效率不同方面最全面的分析。

关键词

引用

@article{arxiv.2209.09593,
  title  = {EffEval: A Comprehensive Evaluation of Efficiency for MT Evaluation Metrics},
  author = {Daniil Larionov and Jens Grünwald and Christoph Leiter and Steffen Eger},
  journal= {arXiv preprint arXiv:2209.09593},
  year   = {2023}
}

备注

Findings of EMNLP 2023; note the title and author change