用于调整合成数据集中特征的工具框架
数据库
2018-01-12 v1
摘要
研究人员与开发者使用基准测试来比较其算法与产品。数据库基准测试必须拥有数据集 D。为具应用针对性,该数据集 D 应为经验性的。然而,D 对于基准实验可能过小或过大。因此,D 必须被缩放到所需大小。为确保缩放后的 D' 与 D 相似,以往工作通常从 D 中指定或提取固定特征集 F = {F_1, F_2, . . . , F_n},随后利用 F 生成 D' 的合成数据。然而,随着 F 增大,此方法(D -> F -> D')变得愈发难以处理,故亟需新方案。不同于现有方法,本文提出 ASPECT 来缩放 D 以强制相似性。ASPECT 首先使用尺寸缩放器(S0)将 D 缩放为 D'。随后用户选择一组期望特征 F'_1, . . . , F'_n。对于每个期望特征 F'_k,存在一个调整工具 T_k 来调整 D' 以确保 D' 具备所需特征 F'_k。ASPECT 协调 T_1,...,T_n 对 D' 的调整,使得 T_n(...(T_1(D'))...) 具备所需特征 F'_1,...,F'_n。通过从 D -> F -> D' 转向 D -> D' -> F',数据缩放变得灵活。用户可用其感兴趣的特征自定义缩放数据集。在真实数据集上的大量实验表明,ASPECT 能有效且高效地强制数据集中的相似性。
引用
@article{arxiv.1801.03645,
title = {A tool framework for tweaking features in synthetic datasets},
author = {J. W. Zhang and Y. C. Tay},
journal= {arXiv preprint arXiv:1801.03645},
year = {2018}
}