SimEx:基于自编码器集群的数据集间相似性快速预测
机器学习
2020-01-15 v1 计算机视觉与模式识别
摘要
知晓数据集合之间的相似性对于训练有效模型具有若干积极作用,例如辅助从已知数据集中明智地选择有利于模型迁移或未知数据集数据增强问题的数据集。估计数据间相似性的常见做法包括在原始样本空间中比较、在执行特定任务的模型所提取的嵌入空间中比较,或用不同数据集微调预训练模型并据此评估性能变化。然而,这些做法分别受制于浅层比较、任务特定偏差,或进行比较所需的大量时间与计算量。我们提出 SimEx,一种利用一组预训练自编码器(每个专门用于重建已知数据的特定部分)早期预测数据集间相似性的新方法。具体而言,我们的方法将未知数据样本作为这些预训练自编码器的输入,并评估重建输出样本与原始输入样本之间的差异。我们的直觉是,未知数据样本与某自编码器所训练知的已知数据部分越相似,该自编码器越能利用其习得知识,重建出更接近原始的样本。我们证明,与常见相似性估计做法相比,我们的方法在预测数据集间相似性上实现了超过 10 倍的加速。我们还证明,由本方法估计的数据集间相似性与常见做法高度相关,且在样本空间或嵌入空间比较的基线方法上表现更优,且在比较时无需任何新训练。
引用
@article{arxiv.2001.04893,
title = {SimEx: Express Prediction of Inter-dataset Similarity by a Fleet of Autoencoders},
author = {Inseok Hwang and Jinho Lee and Frank Liu and Minsik Cho},
journal= {arXiv preprint arXiv:2001.04893},
year = {2020}
}
备注
12 pages