中文

用表征相似性分析探测代码语言模型的语义接地

材料科学 2022-08-04 v1 介观与纳米尺度物理 应用物理 光学

摘要

表征相似性分析是认知 neuroscience 中的一种方法,有助于比较来自两个不同数据源的表征。本文提出使用表征相似性分析来探测代码语言模型中的语义接地。我们利用 IBM CodeNet 数据集的数据,探测 CodeBERT 模型的表征是否具有语义接地。通过实验,我们表明当前的预训练方法并未在代码语言模型中诱导出语义接地,而是专注于优化基于形式的模式。我们还表明,即使在语义相关任务上进行少量微调,也能显著提升 CodeBERT 的语义接地。我们对 CodeBERT 模型输入模态的消融实验显示,在语义微调中使用双模态输入(代码与自然语言)优于单模态输入(仅代码),具有更好的语义接地与样本效率。最后,我们对代码进行语义扰动的实验揭示,CodeBERT 能够稳健区分语义正确与不正确的代码。

关键词

引用

@article{arxiv.2207.07707,
  title  = {Controlling polarization of spintronic THz emitter by remanent magnetization texture},
  author = {Weipeng Wu and Sergi Lendinez and Mojtaba Taghipour Kaffash and Richard D. Schaller and Haidan Wen and M. Benjamin Jungfleisch},
  journal= {arXiv preprint arXiv:2207.07707},
  year   = {2022}
}