超越自学习注意力:利用注意力引导缓解基于 Transformer 模型中的注意力偏差
软件工程
2024-02-27 v1 人工智能
摘要
基于 Transformer 的模型在软件工程的源代码建模任务中展现了巨大潜力。然而,它们受限于仅依赖自动自注意力权重学习机制。先前的研究表明,这些模型过度强调分词器添加的分隔符(例如 [CLS]、[SEP]),这可能导致忽略原始输入源代码中的重要信息。为应对这一挑战,我们引入了 SyntaGuid,这是一种新颖的方法,利用了以下观察结果:在微调后的语言模型做出正确预测时,注意力权重往往偏向特定的源代码语法标记和抽象语法树 (AST) 元素。SyntaGuid 促进了注意力权重学习的引导,从而提高了在各种软件工程任务上的模型性能。我们在多个任务上评估了 SyntaGuid 的有效性,并证明其在整体性能上优于现有的最先进模型,且无需额外数据。实验结果表明,SyntaGuid 可将整体性能提高多达 3.25%,并修正多达 28.3% 的错误预测。我们的工作首次尝试在微调过程中将基于 Transformer 的模型的注意力引导至关键的源代码标记,突显了增强软件工程领域基于 Transformer 模型的潜力。
引用
@article{arxiv.2402.16790,
title = {Beyond Self-learned Attention: Mitigating Attention Bias in Transformer-based Models Using Attention Guidance},
author = {Jiri Gesi and Iftekhar Ahmed},
journal= {arXiv preprint arXiv:2402.16790},
year = {2024}
}