中文

基于句子嵌入的面向目标聊天机器人训练的子模性启发式数据选择

计算与语言 2018-07-10 v2

摘要

口语语言理解(SLU)系统,如面向目标的聊天机器人或个人助手,依赖于初始的自然语言理解(NLU)模块来确定意图并从作为输入的用户查询中提取相关信息。SLU 系统通常帮助用户在相对狭窄的领域中解决问题,并需要大量领域内训练数据。这导致了显著的数据可用性问题,阻碍了成功系统的开发。为缓解此问题,我们提出了一种低数据 regime 下的数据选择技术,使我们能用更少的标注句子进行训练,从而降低标注成本。我们提出了一种子模性启发式的数据排序函数,即比率惩罚边际增益,用于仅基于从文本嵌入空间提取的信息来选择要标注的数据点。我们展示了嵌入空间中的距离是一种可行的信息来源,可用于数据选择。我们的方法优于两种已知的主动学习技术,并实现了 NLU 单元的成本高效训练。此外,我们提出的选择技术不需要在 selection 步骤之间重新训练模型,也使其时间高效。

关键词

引用

@article{arxiv.1802.00757,
  title  = {Submodularity-Inspired Data Selection for Goal-Oriented Chatbot Training Based on Sentence Embeddings},
  author = {Mladen Dimovski and Claudiu Musat and Vladimir Ilievski and Andreea Hossmann and Michael Baeriswyl},
  journal= {arXiv preprint arXiv:1802.00757},
  year   = {2018}
}