中文

稀疏数据下社区检测的加权相似度度量

统计方法学 2025-02-10 v2 社会与信息网络

摘要

许多自然语言处理(NLP)相关应用涉及从短文档(如消费者评论和社交媒体帖子)中派生的主题和情感。由于短文档通常只涵盖数百个候选主题中的少数几个主题,短文档的主题和情感高度稀疏。在高度稀疏的数据上,插值缺失数据有时难以证明,也常常不切实际。我们 developed 一种用于计算高度稀疏数据加权相似度的方法,而无需插值。这种加权相似度包含三个组成部分,以捕捉基于存在性和缺失公共属性以及缺失值模式的相似性。在案例研究中,我们使用社区检测算法和这种加权相似度将基于稀疏主题情感从短消费者评论中派生的不同洗发水品牌进行分组。与传统插值和相似度 measure 相比,加权相似度在一般社区结构和平均社区质量方面表现更好。该性能在各种指标和社区复杂度下保持一致且稳健。

关键词

引用

@article{arxiv.2501.07025,
  title  = {A Weighted Similarity Metric for Community Detection in Sparse Data},
  author = {Yong Zhang and Eric Herrison Gyamfi},
  journal= {arXiv preprint arXiv:2501.07025},
  year   = {2025}
}

备注

This paper has been accepted for Workshop of AI for Social Impact at AAAI 2025