中文

如何提高Kohonen映射的鲁棒性并在因子分析中展示附加信息:文本挖掘中的应用

统计理论 2015-06-26 v1 计算与语言 统计理论

摘要

本文是WSOM'2012会议[1]上发表论文的扩展版。我们展示了一种结合因子投影、SOM算法与图技术并应用于文本挖掘问题的方法。语料库包含8份用于向商人传授算术技巧的中世纪手稿。在数据分析技术中,那些用于词汇计量学的技术(如因子分析)突出了手稿间的差异。其原因就在于它们关注词与手稿之间独立性的偏离。然而,我们也希望发现并刻画整个语料库中的共同词汇。利用随机Kohonen映射的性质(其以非确定性方式定义输入间的邻域),我们突出了那些在词汇中似乎扮演特殊角色的词。我们称之为易变词(fickle),并利用它们同时提高Kohonen映射的鲁棒性以及FCA可视化的显著性。最后我们使用图算法利用这种易变性对词进行分类。

关键词

引用

@article{arxiv.1506.07732,
  title  = {How to improve robustness in Kohonen maps and display additional information in Factorial Analysis: application to text mining},
  author = {Nicolas Bourgeois and Marie Cottrell and Benjamin Déruelle and Stéphane Lamassé and Patrick Letrémy},
  journal= {arXiv preprint arXiv:1506.07732},
  year   = {2015}
}