中文

利用停顿信息实现更精确的实体识别

计算与语言 2021-09-28 v1 机器学习

摘要

人机对话中的实体标签对于对话助手的自然语言理解(NLU)任务至关重要。然而,当前系统仅典型地使用文本输入,难以准确解析口语查询,且常无法理解用户意图。语言学先前工作已确定一种跨语言趋势:与动词相比,名词周围的语音停顿更长。我们展示了关于停顿的语言学观察可用于提升机器学习的语言理解任务的准确性。对来自商业语音助手的法语和英语话语中停顿的分析显示,多 token 实体跨度边界处的停顿时长与实体跨度内部相比存在统计显著差异。此外,与基于文本的 NLU 不同,我们应用停顿时长来丰富上下文嵌入,以改善实体的浅层解析。结果表明,我们提出的新嵌入在法语三个领域上一致地将相对错误率降低了多达 8%,且未给解析器带来任何额外的标注或对齐成本。

关键词

引用

@article{arxiv.2109.13222,
  title  = {Using Pause Information for More Accurate Entity Recognition},
  author = {Sahas Dendukuri and Pooja Chitkara and Joel Ruben Antony Moniz and Xiao Yang and Manos Tsagkias and Stephen Pulman},
  journal= {arXiv preprint arXiv:2109.13222},
  year   = {2021}
}

备注

Accepted at the 3rd Workshop on NLP for Conversational AI (EMNLP 2021)