中文

通过端到端上下文感知聚类为开放式回答调查提供洞察

机器学习 2022-10-11 v2 人工智能 计算与语言

摘要

教师常开展调查以从预定义的学生群体中收集数据,从而获取感兴趣主题的洞察。在分析含开放式文本回答的调查时,手动将所有回答处理为富有洞察且全面的报告极其耗时、费力且困难。在分析阶段,教师传统上须阅读每条回答并决定如何分组以提取洞察信息。尽管仅使用某些关键词对回答分组是可行的,但该方法受限:既未考虑嵌入上下文,也无法检测多义词或短语以及无法用单个词表达语义。本工作中,我们提出一种新颖的端到端上下文感知框架,可提取、聚合并缩写开放式回答调查数据中的嵌入语义模式。我们的框架依赖预训练自然语言模型将文本数据编码为语义向量。编码向量随后被聚类为最优调优数量的组或具预指定标题的组集合。前者情况下,进一步分析聚类以提取代表性关键词或摘要句作为簇标签。框架中,我们对指定簇最终提供上下文感知词云,展示各组内语义显著的关键词。兼顾用户隐私,我们成功构建了适用于移动设备实时分析的端侧实现,并在合成数据集上测试。我们的框架通过自动化从调查数据提取最具洞察信息片段的过程,降低了规模化成本。

关键词

引用

@article{arxiv.2203.01294,
  title  = {Providing Insights for Open-Response Surveys via End-to-End Context-Aware Clustering},
  author = {Soheil Esmaeilzadeh and Brian Williams and Davood Shamsi and Onar Vikingstad},
  journal= {arXiv preprint arXiv:2203.01294},
  year   = {2022}
}