InfeRE:基于推理链的正则表达式逐步生成
人工智能
2023-08-09 v1 计算与语言
摘要
从自然语言描述自动生成正则表达式(简称 regex,NL2RE)是一个新兴的研究领域。先前研究将正则表达式视为 token 的线性序列,并以单次自回归方式生成最终表达式。它们未考虑最终结果与背后逐步的内部文本匹配过程。这显著阻碍了神经语言模型生成正则表达式的效率与可解释性。本文提出一种称为 InfeRE 的新范式,将正则表达式的生成分解为逐步推理链。为增强鲁棒性,我们引入了自一致性解码机制,集成从不同的模型采样的多个输出。我们在两个公开数据集 NL-RX-Turk 和 KB13 上评估 InfeRE,并将结果与最先进方法以及流行的基于树的生成方法 TRANX 进行比较。实验结果显示 InfeRE 大幅优于先前基线,在两个数据集上 DFA@5 准确率分别提升 16.3% 和 14.7%。特别是在 DFA@5 准确率上,InfeRE 分别比流行的基于树的生成方法高出 18.1% 和 11.3%。
引用
@article{arxiv.2308.04041,
title = {InfeRE: Step-by-Step Regex Generation via Chain of Inference},
author = {Shuai Zhang and Xiaodong Gu and Yuting Chen and Beijun Shen},
journal= {arXiv preprint arXiv:2308.04041},
year = {2023}
}
备注
This paper has been accepted by ASE'23