用于解析程序代码中引用的数学模型
机器学习
2026-04-16 v1 神经与进化计算
摘要
解析和重写引用是编程语言中的基本任务。为了解决实际的逆向工程问题,我们将引用重写抽象为置换下的直接索引和间接索引问题。我们为这些任务创建了合成基准数据集,并指出众所周知的序列到序列机器学习架构在这些基准数据集上表现不佳。我们为这两个问题引入了新的序列到序列架构。我们的测量结果表明,我们的架构在鲁棒性和可扩展性方面均优于基线方法:我们的模型可以处理比最佳基线方法可处理的示例长度大十倍。我们测量了我们的架构在实际任务中对 switch 语句逆向工程的影响,其中包含一个索引子任务。根据我们的测量结果,扩展后的模型将错误率降低了 42%。多项消融研究表明,我们的架构的所有组成部分都至关重要。
引用
@article{arxiv.2604.14073,
title = {Neural architectures for resolving references in program code},
author = {Gergő Szalay and Gergely Zsolt Kovács and Sándor Teleki and Balázs Pintér and Tibor Gregorics},
journal= {arXiv preprint arXiv:2604.14073},
year = {2026}
}