利用半监督学习方法从反馈与支持数据中发掘企业用户洞察
机器学习
2020-07-23 v3 计算与语言
机器学习
摘要
随着云和客户中心文化的发展,我们天然积累了海量的文本评论、反馈和支持数据仓库。这促使企业寻求和研究参与模式、用户网络分析、主题检测等。然而,仍需大量人工工作来挖掘数据以获得可操作的成果。在本文中,我们提出并开发了一种创新的半监督学习方法,通过利用深度学习和主题建模来更好地理解用户声音。该方法结合了通过监督学习的基于 BERT 的多分类算法,以及通过无监督学习的新型概率与语义混合主题推断(PSHTI)模型,旨在自动化更好地从文本反馈和支持中识别主要主题或领域以及子主题的过程。有三大突破:1. 随着深度学习技术的进步,NLP 领域出现了巨大创新,但作为 NLP 应用之一的传统主题建模落后于深度学习的浪潮。在方法论和技术视角上,我们采用迁移学习来微调基于 BERT 的多分类系统以对主要主题分类,然后利用新型 PSHTI 模型在预测的主要主题下推断子主题。2. 传统的基于无监督学习的主题模型或聚类方法难以自动生成有意义的主题标签,而我们的系统通过利用关于产品的领域知识进行网络爬取,能够将关键词映射到自助问题。3. 本工作通过在真实生产中利用最先进的方法提供了一个突出的展示案例,有助于揭示用户洞察并驱动业务投资优先级。
引用
@article{arxiv.2007.09303,
title = {Semi-Supervised Learning Approach to Discover Enterprise User Insights from Feedback and Support},
author = {Xin Deng and Ross Smith and Genevieve Quintin},
journal= {arXiv preprint arXiv:2007.09303},
year = {2020}
}
备注
7 pages, 7 figures, 2 tables