教育用例下概率模型与深度学习模型在合成表格数据生成上的比较
机器学习
2022-10-18 v1
摘要
生成合成数据的能力在不同领域具有多种用例。在教育研究中,对访问合成数据以检验某些概念与想法存在日益增长的需求。近年来,若干深度学习架构被用于辅助合成数据生成,但结果参差不齐。在教育背景下,实现需要大型数据集的不同模型的复杂性正变得非常重要。本研究旨在比较一种概率模型(具体为贝叶斯网络)与一种深度学习模型(具体为生成对抗网络,使用分类任务)在合成表格数据生成上的应用。本研究结果表明,由于概率相互依赖,合成表格数据生成更适用于教育背景下的概率模型(总体准确率 75%)而非深度学习架构(总体准确率 38%)。最后,我们建议应探索和评估其他数据类型在教育用例合成数据生成中的应用。
引用
@article{arxiv.2210.08528,
title = {Comparing Synthetic Tabular Data Generation Between a Probabilistic Model and a Deep Learning Model for Education Use Cases},
author = {Herkulaas MvE Combrink and Vukosi Marivate and Benjamin Rosman},
journal= {arXiv preprint arXiv:2210.08528},
year = {2022}
}
备注
11 paged, 5 figures, Proceedings for the SACAIR 2023 Conference