基于问题-描述相关性正则化的代码检索对抗训练
计算与语言
2020-11-11 v2 人工智能
信息检索
编程语言
摘要
代码检索是一项旨在匹配自然语言与编程语言的关键任务。本工作中,我们提出用于代码检索的对抗学习,并由问题-描述相关性正则化。首先,我们采用一种简单的对抗学习技术,在给定输入问题下生成困难代码片段,这有助于面临双模态与数据稀缺挑战的代码检索学习。其次,我们提出利用问题-描述相关性来正则化对抗学习,使得所生成的代码片段仅当其配对的自然语言描述被预测为与用户给定问题较不相关时,才对代码检索训练损失贡献更多。在两种编程语言的大规模代码检索数据集上的实验表明,我们的对抗学习方法能够提升最先进模型的性能。此外,使用额外的重复问题预测模型来正则化对抗学习进一步提升了性能,且这比在强多任务学习基线中使用重复问题更有效。
引用
@article{arxiv.2010.09803,
title = {Adversarial Training for Code Retrieval with Question-Description Relevance Regularization},
author = {Jie Zhao and Huan Sun},
journal= {arXiv preprint arXiv:2010.09803},
year = {2020}
}
备注
Accepted to Findings of EMNLP 2020. 11 pages, 2 figures