中文

推进零售数据科学:合成数据的综合评估

机器学习 2024-06-21 v1 机器学习

摘要

合成数据生成的评估至关重要,尤其是在数据准确性至关重要的零售领域。本文介绍了一个用于评估合成零售数据的综合框架,重点关注保真度、效用和隐私性。我们的方法区分了连续和离散数据属性,提供了精确的评估标准。保真度通过稳定性和泛化性来衡量。稳定性确保合成数据准确复现已知的数据分布,而泛化性则验证其在新型场景中的鲁棒性。效用通过合成数据在关键零售任务(如需求预测和动态定价)中的有效性来证明,证明了其在预测分析和战略规划中的价值。隐私性通过差分隐私得到保障,确保合成数据在模仿训练集和保留数据集之间保持完美平衡,同时不损害安全性。我们的研究结果验证了该框架为合成零售数据提供了可靠且可扩展的评估。它确保了高保真度、高效用和高隐私性,使其成为推进零售数据科学的重要工具。该框架精准且可靠地满足了零售行业不断变化的需求,为合成数据方法的未来进步铺平了道路。

关键词

引用

@article{arxiv.2406.13130,
  title  = {Advancing Retail Data Science: Comprehensive Evaluation of Synthetic Data},
  author = {Yu Xia and Chi-Hua Wang and Joshua Mabry and Guang Cheng},
  journal= {arXiv preprint arXiv:2406.13130},
  year   = {2024}
}