中文

请用英语:使用大型语言模型评估多语言 bug 报告的机器翻译

计算与语言 2025-05-12 v4 软件工程

摘要

准确翻译 bug 报告对于高效的全球软件开发协作至关重要。本研究首次全面评估了机器翻译(MT)在 bug 报告上的性能,分析了 DeepL、AWS Translate 以及 ChatGPT、Claude、Gemini、LLaMA 和 Mistral 等大型语言模型的能力,这些模型使用来自 Visual Studio Code GitHub 仓库的数据,特别关注标记为 english-please tag 的报告。为评估翻译质量和源语言识别准确性,我们采用各种 MT 评估指标,包括 BLEU、BERTScore、COMET、METEOR 和 ROUGE,以及分类指标如准确率、精确率、召回率和 F1 分数。我们的发现表明,尽管 ChatGPT(gpt-4o)在语义和词汇翻译质量方面表现突出,但在源语言识别方面并非领先。Claude 和 Mistral 在 F1 分数(0.7182 和 0.7142)方面取得最佳成绩,Gemini 记录了最佳精确率(0.7414)。AWS Translate 在识别源语言的准确率(0.4717)方面表现最佳。这些结果表明没有单一系统在所有任务中都占据优势,强调了基于任务的评估的重要性。本研究强调在翻译技术内容时需要进行领域适应,并为将 MT 集成到 bug 分诊工作流程中提供了可操作的见解。本论文的代码和数据集可在 GitHub-https://github.com/av9ash/English-Please 上获取。

关键词

引用

@article{arxiv.2502.14338,
  title  = {English Please: Evaluating Machine Translation with Large Language Models for Multilingual Bug Reports},
  author = {Avinash Patil and Siru Tao and Aryan Jadon},
  journal= {arXiv preprint arXiv:2502.14338},
  year   = {2025}
}

备注

8 Pages, 4 Figures, 3 Tables