中文

评估与提升预训练模型在代码翻译中的语法对抗鲁棒性

软件工程 2023-10-31 v1

摘要

背景:预训练模型(PTM)在自动代码翻译中已展现出显著潜力。然而,这些模型在翻译任务中的脆弱性,尤其在语法方面,尚未得到广泛研究。目标:为填补这一空白,本研究旨在提出一种新方法 CoTR,用于评估并提升 PTM 在代码翻译中的语法对抗鲁棒性。方法:CoTR 由两个组件构成:CoTR-A 与 CoTR-D。CoTR-A 通过对程序进行变换来生成对抗样本,而 CoTR-D 提出一种基于语义距离的采样数据增强方法与对抗训练方法,以提升模型的鲁棒性与泛化能力。CoTR 采用 Pass@1 指标评估 PTM 的性能,该指标更适用于代码翻译任务,并在真实场景中得到更精确的评估。结果:通过在真实世界 Java 到 Python 数据集上的实验对 CoTR 的有效性进行了评估。结果表明,CoTR-A 能显著降低现有 PTM 的性能,而 CoTR-D 有效提升了 PTM 的鲁棒性。结论:本研究揭示了当前 PTM(包括大语言模型)在代码翻译任务中的局限性,并凸显了 CoTR 作为一种有效解决方案在增强 PTM 代码翻译任务鲁棒性方面的潜力。

关键词

引用

@article{arxiv.2310.18587,
  title  = {Assessing and Improving Syntactic Adversarial Robustness of Pre-trained Models for Code Translation},
  author = {Guang Yang and Yu Zhou and Xiangyu Zhang and Xiang Chen and Tingting Han and Taolue Chen},
  journal= {arXiv preprint arXiv:2310.18587},
  year   = {2023}
}

备注

under review