基于邻域树的关系聚类表达性相异度度量
机器学习
2017-09-29 v2 人工智能
机器学习
摘要
聚类是一项定义不清的任务:对于何为良好聚类并无通用准则。对于关系数据而言尤其如此,其相似性可基于个体的特征、它们之间的关系,或两者的混合。现有的关系聚类方法在这方面具有强烈且常为隐式的偏置。本文引入一种针对关系数据的新型相似性度量。它是首个融合了多种相似性类型的度量,包括属性相似性、关系上下文相似性以及超图中的邻近性。我们通过实验评估了在标准聚类方法中使用该相似性对不同类型数据集聚类质量的影响。实验表明:(a) 在标准聚类方法中使用该相似性始终能给出良好结果,而其他度量仅在与其偏置相匹配的数据集上表现良好;(b) 在大多数数据集上,该新型相似性甚至优于现有度量中最佳者。
引用
@article{arxiv.1604.08934,
title = {An expressive dissimilarity measure for relational clustering using neighbourhood trees},
author = {Sebastijan Dumancic and Hendrik Blockeel},
journal= {arXiv preprint arXiv:1604.08934},
year = {2017}
}
备注
9 pages, 3 figures, 4 tables, submitted to ECMLPKDD 2017