中文

增强数据作为辅助插件用于众包遗产数据的分类

机器学习 2021-07-09 v1

摘要

本文中,我们提出一种通过引入数据增强作为辅助插件来缓解聚类性能低效问题的策略。诸如K-means、高斯混合模型和谱聚类等经典聚类技术是许多数据驱动应用的核心。然而,近期使用神经网络的无监督同步特征学习与聚类(即深度嵌入聚类,DEC)已获得关注。深度特征聚类的开创性工作聚焦于定义相关聚类损失函数以及选择恰当的神经网络来提取特征。所有这些情况中的一个核心问题是数据稀疏性伴随高类内低类间方差,这进而导致差的聚类性能与错误的候选分配。为此,我们采用数据增强技术来改善簇的密度,从而提升整体性能。我们训练一个带增强数据的卷积自编码器(CAE)变体来构建初始特征空间,作为一种新颖的深度聚类模型。我们在众包印度遗产数据集上展示了所提策略的结果。大量实验表明相较现有工作有持续改进。

关键词

引用

@article{arxiv.2107.03852,
  title  = {Augmented Data as an Auxiliary Plug-in Towards Categorization of Crowdsourced Heritage Data},
  author = {Shashidhar Veerappa Kudari and Akshaykumar Gunari and Adarsh Jamadandi and Ramesh Ashok Tabib and Uma Mudenagudi},
  journal= {arXiv preprint arXiv:2107.03852},
  year   = {2021}
}