中文

一种用于大规模文本标注的自适应深度聚类流水线

计算与语言 2022-07-27 v2 机器学习

摘要

从大量自然语言输入中挖掘潜在意图,是帮助数据分析师为客服与销售支持设计和优化智能虚拟助手(IVAs)的关键步骤。我们在 Verint Intent Manager(VIM)中创建了一个灵活且可扩展的聚类流水线,它集成了语言模型的微调、高性能 k-NN 库和社区检测技术,以帮助分析师快速从对话文本中浮现并组织相关用户意图。微调步骤是必要的,因为预训练语言模型在目标文本来自未知领域或聚类任务并非主题检测时,无法有效地编码文本以浮现特定聚类结构。我们描述了该流水线,并在三个真实世界文本挖掘任务上展示了其性能与可扩展性。作为在 VIM 应用中部署的组件,该聚类流水线产生了高质量结果,提升了数据分析师的性能,并减少了从客服数据中浮现意图所需的时间,从而缩短了在新领域构建和部署 IVAs 的时间。

关键词

引用

@article{arxiv.2202.01211,
  title  = {An Adaptive Deep Clustering Pipeline to Inform Text Labeling at Scale},
  author = {Xinyu Chen and Ian Beaver},
  journal= {arXiv preprint arXiv:2202.01211},
  year   = {2022}
}

备注

Presented at DataPerf 2022 Workshop at ICML 2022. arXiv admin note: substantial text overlap with arXiv:2202.00802