中文

SUT:面向转编译模型的主动缺陷探测

软件工程 2023-10-24 v1 机器学习

摘要

自动程序翻译具有巨大的应用价值,因此一直吸引着 AI 研究人员的显著兴趣。然而,我们观察到当前的程序翻译模型仍会犯基本的语法错误,特别是当目标语言不具有源语言中的语法元素时。诸如 BLUE、CodeBLUE 和计算准确率之类的指标可能无法暴露这些问题。在本文中,我们为编程语言翻译引入了一种新指标,这些指标解决了这些基本语法错误。我们开发了一种称为语法单元测试(SUT)的新型主动缺陷探测套件,其包含一个用于准确率和测试评分的极具可解释性的评估框架。实验表明,即使是像 ChatGPT 这样强大的模型仍会在这些基本单元测试上出错。具体而言,与先前的程序翻译任务评估数据集相比,其在我们的单元测试上的通过率下降了 26.15%。此外,我们的评估框架揭示了这些模型表现出不足的语法元素错误。

关键词

引用

@article{arxiv.2310.14209,
  title  = {SUT: Active Defects Probing for Transcompiler Models},
  author = {Mengnan Qi and Yufan Huang and Maoquan Wang and Yongqiang Yao and Zihan Liu and Bin Gu and Colin Clement and Neel Sundaresan},
  journal= {arXiv preprint arXiv:2310.14209},
  year   = {2023}
}