半监督交互式意图标注
计算与语言
2021-05-13 v2 人机交互
摘要
构建面向任务的口语对话系统 (SDS) 的自然语言理解 (NLU) 模块涉及意图与实体的定义、任务相关数据的收集、用意图与实体标注数据,然后为向 SDS 添加任何功能/增强而反复进行相同过程。本工作中,我们展示了一个意图批量标注系统,其中 SDS 开发者可使用先进聚类与可视化标注方法从未标注话语语料库中交互式标注并增广训练数据。我们以更好的骨干 BERT 模型扩展 Deep Aligned Clustering 工作,探索用于选择标注种子数据的技术,并开发一种利用释义模型进行过采样的数据平衡方法。我们也考察了数据增广对聚类过程的影响。结果显示,使用上述技术组合我们在某些数据集上可实现超过 10% 的聚类精度提升。最后,我们从聚类模型提取话语嵌入并绘制数据以交互式批量标注样本,显著减少了整个数据集数据标注的时间与精力。
引用
@article{arxiv.2104.13406,
title = {Semi-supervised Interactive Intent Labeling},
author = {Saurav Sahay and Eda Okur and Nagib Hakim and Lama Nachman},
journal= {arXiv preprint arXiv:2104.13406},
year = {2021}
}
备注
NAACL 2021 - Workshop on Data Science with Human-in-the-loop: Language Advances (DaSH-LA)