基于概念预训练的低资源组合语义解析
计算与语言
2023-02-01 v2
摘要
语义解析通过将自然语言映射为结构化意义表示,在Alexa、Siri和Google Assistant等数字语音助手中发挥关键作用。当我们希望通过添加新领域来改进语音助手的能力时,底层的语义解析模型需要使用来自新领域的数千个标注样本重新训练,这既耗时又昂贵。在本工作中,我们提出一种架构,仅利用关于新领域的少量元数据,并在无任何新训练数据(零样本)或极少样本(少样本)的情况下自动执行此类领域适配。我们使用基础的seq2seq(序列到序列)架构,并用一个概念编码器对其进行增强,该编码器对新领域的意图和槽位标签进行编码。我们还引入一种新颖的以解码器为中心的方法,使用Wikidata对seq2seq模型进行概念感知预训练,并借此帮助我们的模型学习重要概念并在低资源设定下表现良好。我们在TOPv2数据集上报告了组合语义解析的少样本和零样本结果,并表明我们的模型在TOPv2和SNIPS数据集的少样本设定下优于先前的方法。
引用
@article{arxiv.2301.09809,
title = {Low-Resource Compositional Semantic Parsing with Concept Pretraining},
author = {Subendhu Rongali and Mukund Sridhar and Haidar Khan and Konstantine Arkoudas and Wael Hamza and Andrew McCallum},
journal= {arXiv preprint arXiv:2301.09809},
year = {2023}
}
备注
EACL 2023