聚类任务自监督中数据变换的洞察
机器学习
2020-02-19 v1 机器学习
统计理论
统计理论
摘要
自监督是扩展深度学习在标签稀缺领域应用的关键。对于大多数自监督方法,数据变换起着重要作用。然而,迄今为止数据变换的影响尚未被研究。此外,不同的变换对系统可能有不同的影响。我们提供了关于自监督任务中数据变换使用的新洞察,特别是与聚类相关的部分。我们从理论和经验上表明,某些变换集合有助于自监督聚类的收敛。我们也展示了变换无益甚至在某些情况下有害的情形。我们展示了在凸目标以及某类非凸目标下,有效变换带来的更快收敛速率,并给出了收敛到原始最优集的证明。我们进行了合成与真实世界数据实验。经验上,我们的结果与所提供的理论洞察一致。
引用
@article{arxiv.2002.07384,
title = {Data Transformation Insights in Self-supervision with Clustering Tasks},
author = {Abhimanu Kumar and Aniket Anand Deshmukh and Urun Dogan and Denis Charles and Eren Manavoglu},
journal= {arXiv preprint arXiv:2002.07384},
year = {2020}
}