中文

基于噪声鲁棒学习的软件实体识别

软件工程 2023-08-22 v1 计算与语言

摘要

从自由文本中识别库名等软件实体,对实现诸多软件工程(SE)技术(如可追溯链接恢复、自动化文档与 API 推荐)至关重要。尽管已提出许多方法解决此问题,它们受限于较小的实体词表或含噪训练数据,阻碍了其从复杂叙述中识别软件实体的能力。为应对该挑战,我们利用 Wikipedia 分类体系开发了包含 12 种细粒度类型、79K 个唯一软件实体的综合实体词典,以及逾 170 万句的大规模标注数据集。进而,我们提出自正则化这一噪声鲁棒学习方法,通过考虑大量 dropout 来训练我们的软件实体识别(SER)模型。结果表明,经自正则化训练的模型在我们的 Wikipedia 基准与两个 Stack Overflow 基准上均优于其原始对应模型与最先进方法。我们发布了模型、数据与代码以供未来研究。

关键词

引用

@article{arxiv.2308.10564,
  title  = {Software Entity Recognition with Noise-Robust Learning},
  author = {Tai Nguyen and Yifeng Di and Joohan Lee and Muhao Chen and Tianyi Zhang},
  journal= {arXiv preprint arXiv:2308.10564},
  year   = {2023}
}

备注

ASE 2023