中文

健康与医学语料库中的模糊方法主题发现

机器学习 2017-05-29 v2 计算与语言 信息检索

摘要

大多数医学文档和电子健康记录(EHR)为文本格式,这给数据处理和查找相关文档带来了挑战。寻找自动检索海量健康与医学知识的方法一直是一个引人入胜的话题。近年来已开发出强大的方法使文本处理自动化。基于健康与医学语料库主题发现来检索信息的一种流行方法是主题建模,然而该方法仍需要新的视角。在本研究中,我们描述了模糊潜在语义分析(FLSA),一种利用模糊视角进行主题建模的新方法。FLSA 能处理健康与医学语料库的冗余问题,并提供一种估计主题数量的新方法。定量评估表明,FLSA 相较于最流行的主题模型——潜在狄利克雷分配(LDA),产生了更优的性能和特征。

关键词

引用

@article{arxiv.1705.00995,
  title  = {Fuzzy Approach Topic Discovery in Health and Medical Corpora},
  author = {Amir Karami and Aryya Gangopadhyay and Bin Zhou and Hadi Kharrazi},
  journal= {arXiv preprint arXiv:1705.00995},
  year   = {2017}
}

备注

12 Pages, International Journal of Fuzzy Systems, 2017