中文

以极少数据训练自然化语义解析器

计算与语言 2022-05-05 v2

摘要

语义解析是一个重要的NLP问题,尤其对于Alexa和Google Assistant等语音助手。最先进的(SOTA)语义解析器是基于已在海量文本上预训练的大型语言模型的seq2seq架构。为了更好地利用该预训练,近期工作探索了一种语义解析的重构,其中输出序列本身是自然语言句子,但处于自然语言的受控片段中。该方法取得了强劲结果,特别是对于少样本语义解析,这在实际应用中至关重要且是本文的重点。我们推进这一工作线,引入一种自动化方法,通过利用通常易于获得的适量未标注数据,带来了非常显著的额外改进。我们的方法基于四种技术的新颖综合:带辅助无监督任务的联合训练、约束解码、自训练和复述。我们展示了该方法在Overnight数据集上取得了新的SOTA少样本性能,特别是在极低资源设定下,并在一个新的语义解析数据集上取得了非常有说服力的少样本结果。

关键词

引用

@article{arxiv.2204.14243,
  title  = {Training Naturalized Semantic Parsers with Very Little Data},
  author = {Subendhu Rongali and Konstantine Arkoudas and Melanie Rubino and Wael Hamza},
  journal= {arXiv preprint arXiv:2204.14243},
  year   = {2022}
}

备注

IJCAI 2022