中文

以模糊之鞭驯服狂野的高维文本数据

机器学习 2017-12-19 v1 计算与语言 信息检索 机器学习 应用统计

摘要

词袋(BOW)将语料库表示为一个矩阵,其元素为词频。然而,矩阵中的每一行都是一个非常高维的稀疏向量。降维(DR)是解决稀疏和高维问题的常用方法。在开发 DR 方法的不同策略中,无监督特征变换(UFT)是一种将全部词映射至新基以表示 BOW 的流行策略。近期文本数据的增长及其挑战意味着 DR 领域仍需要新视角。尽管基于 UFT 策略已发展出广泛的方法,但基于该策略的 DR 尚未考虑模糊方法。本研究探讨了将模糊聚类作为基于 UFT 策略的 DR 方法的应用,以压缩 BOW 矩阵,提供文档而非语料库中词的低维表示。定量评估表明,模糊聚类相对于基于 UFT 策略的两种流行 DR 方法主成分分析(PCA)和奇异值分解(SVD)产生了更优的性能和特征。

关键词

引用

@article{arxiv.1712.05997,
  title  = {Taming Wild High Dimensional Text Data with a Fuzzy Lash},
  author = {Amir Karami},
  journal= {arXiv preprint arXiv:1712.05997},
  year   = {2017}
}