中文

GOLD:利用数据增强改进对话中的超出范围检测

计算与语言 2021-09-08 v1

摘要

实用的对话系统需要鲁棒的方法来检测超出范围(OOS)话语,以避免对话中断和相关失效模式。直接用带标签的 OOS 样本训练模型可取得合理性能,但获取此类数据是一个资源密集型过程。为解决这一有限数据问题,以往方法侧重于更好地建模范围内(INS)样本的分布。我们引入 GOLD 作为一种正交技术,通过增强现有数据来训练在低数据条件下运行的更好的 OOS 检测器。GOLD 利用来自辅助数据集的样本生成伪标签候选,并通过一种新颖的过滤机制仅保留最有益的候选用于训练。在三个目标基准的实验中,最佳的 GOLD 模型在所有关键指标上优于所有现有方法,相对于中位基线性能取得了 52.4%、48.9% 和 50.3% 的相对提升。我们还分析了 OOS 数据的独特属性,以确定最优应用我们所提方法的关键因素。

关键词

引用

@article{arxiv.2109.03079,
  title  = {GOLD: Improving Out-of-Scope Detection in Dialogues using Data Augmentation},
  author = {Derek Chen and Zhou Yu},
  journal= {arXiv preprint arXiv:2109.03079},
  year   = {2021}
}

备注

14 pages, 5 figures. Accepted at EMNLP 2021