中文

HPSCAN:基于人类感知的散点数据聚类

机器学习 2025-01-31 v4 人机交互

摘要

聚类分离通常是由广泛使用的聚类技术(如 k-means 或 DBSCAN)处理的任务。然而,这些算法基于非感知度量,我们的实验表明其输出并不能反映人类的聚类感知。为弥合人类聚类感知与机器计算聚类之间的差距,我们提出 HPSCAN,一种直接在散点数据上运行的学习策略。为在此类数据上学习感知聚类分离,我们向 384 名人类参与者众包标注了 7,320 个双变量(散点图)数据集。我们在这些人类标注数据上训练 HPSCAN 模型。我们未将这些数据渲染为散点图图像,而是将其 x 和 y 点坐标作为输入送入修改后的 PointNet++ 架构,从而实现对点云的直接推断。本工作中,我们详述了数据集的收集方式,报告了所得标注的统计数据,并研究了真实世界数据聚类分离的感知一致性。我们还报告了 HPSCAN 的训练与评估协议,并引入一种新度量,用于衡量聚类技术与一组人类标注者之间的准确度。我们探索预测逐点人类一致性以检测歧义。最后,我们将方法与十种已有聚类技术比较,证明 HPSCAN 能够泛化至未见过及分布外数据。

关键词

引用

@article{arxiv.2304.14185,
  title  = {HPSCAN: Human Perception-Based Scattered Data Clustering},
  author = {Sebastian Hartwig and Christian van Onzenoodt and Dominik Engel and Pedro Hermosilla and Timo Ropinski},
  journal= {arXiv preprint arXiv:2304.14185},
  year   = {2025}
}

备注

Currently, this manuscript is under revision at CGF