中文

构建从未存在的虚拟学生:利用大语言模型和 CTGAN 生成合成数据

机器学习 2026-05-21 v1 人工智能

摘要

本研究探讨了人工智能和深度学习技术,特别是生成对抗网络(GAN)和大语言模型(LLM),用于生成合成表格数据的潜力日益增长。获取高质量的学生数据对于推进学习分析至关重要,但隐私问题和全球范围内更严格的数据保护法规限制了其可用性和使用。合成数据作为一种有前景的替代方案。我们研究是否可以利用合成数据来创建用于服务学习分析模型的虚拟学生。通过使用流行的 GAN 模型 CTGAN 和三个大语言模型——GPT2、DistilGPT2 和 DialoGPT,我们生成合成的表格学生数据。我们的结果表明,这些方法具有强大的潜力,能够产生与真实学生数据相似的高质量合成数据集。为验证我们的发现,我们应用了一套全面的实用评估指标来评估合成数据的统计和预测性能,并比较了所使用的不同生成器模型,特别是 LLM 的性能。本研究旨在为学习分析社区提供有价值的见解,关于合成数据的使用,为学习分析数据生成的方法论工具箱提供新的创新方法。

关键词

引用

@article{arxiv.2501.01793,
  title  = {Creating Artificial Students that Never Existed: Leveraging Large Language Models and CTGANs for Synthetic Data Generation},
  author = {Mohammad Khalil and Sam Urmian and Ronas Shakya and Qinyi Liu},
  journal= {arXiv preprint arXiv:2501.01793},
  year   = {2026}
}