探索面向专业数据合成的生成序列模型格局
机器学习
2024-12-20 v2 人工智能
摘要
人工智能研究通常旨在开发能够在复杂数据集上可靠泛化的模型,但在数据稀缺、复杂或难以获取的领域,这仍然具有挑战性。本文介绍了一种利用三种不同复杂度的生成模型来合成最具挑战性的结构化数据集之一——恶意网络流量的新方法。我们的方法独特地将数值数据转换为文本,将数据生成重新框定为语言建模任务,这不仅增强了数据正则化,还显著提高了泛化能力和合成数据的质量。广泛的统计分析证明,我们的方法在生成高保真度合成数据方面超越了最先进的生成模型。此外,我们对合成数据的应用、有效性和评估策略进行了全面研究,为其在各个领域的应用提供了有价值的见解。我们的代码和预训练模型在Github上公开可访问,使我们的方法能够被进一步探索和应用。
引用
@article{arxiv.2411.01929,
title = {Exploring the Landscape for Generative Sequence Models for Specialized Data Synthesis},
author = {Mohammad Zbeeb and Mohammad Ghorayeb and Mariam Salman},
journal= {arXiv preprint arXiv:2411.01929},
year = {2024}
}
备注
25 pages, 7 figures, 3 tables, 1 algorithm. code @ https://github.com/Moe-Zbeeb/Exploring-the-landscape-for-generative-models-for-specialized-data-generation.git