中文

MMF3:基于多模态细粒度特征融合的神经代码摘要方法

软件工程 2022-09-20 v1

摘要

背景:代码摘要根据输入代码自动生成相应的自然语言描述。代码表示的全面性对代码摘要任务至关重要。然而,大多数现有方法通常使用粗粒度融合方法整合多模态特征。它们一般将一段代码的不同模态(如抽象语法树(AST)与令牌序列)表示为两个嵌入,然后在AST/代码层级融合这两个嵌入。这种粗粒度整合难以有效学习跨模态细粒度代码元素间的关联。目的:本研究旨在通过于节点/令牌层级精确对齐并充分融合源代码语义与句法结构信息,提升模型高质量代码摘要的预测性能。方法:本文提出一种用于神经代码摘要的多模态细粒度特征融合方法(MMF3)。我们引入一种新颖的细粒度融合方法,允许在令牌与节点层级对多代码模态进行细粒度融合。具体而言,我们使用该方法融合来自令牌与AST模态的信息,并将融合特征应用于代码摘要。结果:我们在一个Java与一个Python数据集上开展实验,并使用四个度量评估生成摘要。结果显示:1)我们的模型性能优于当前最先进(SOTA)模型;2)消融实验表明我们提出的细粒度融合方法能有效提升生成摘要的准确性。结论:MMF3能够挖掘跨模态元素间关系并据此执行准确的细粒度元素级对齐融合。因此,可提供更多线索以提升生成代码摘要的准确性。

关键词

引用

@article{arxiv.2209.08978,
  title  = {MMF3: Neural Code Summarization Based on Multi-Modal Fine-Grained Feature Fusion},
  author = {Zheng Ma and Yuexiu Gao and Lei Lyu and Chen Lyu},
  journal= {arXiv preprint arXiv:2209.08978},
  year   = {2022}
}

备注

12 pages, 5 figures