评估大型语言模型生成的合成数据的多维度框架
机器学习
2025-07-25 v2 人工智能
计算与语言
摘要
生成式AI和大型语言模型(LLM)的快速发展为生成合成数据,特别是结构化表格格式(如产品评论)提供了新的途径。尽管存在这些潜在益处,但关于隐私泄露的担忧已经浮现,尤其是当个人信息被用于训练数据集时。此外,缺乏一种综合性的评估框架,能够定量衡量生成的合成数据的质量及其对下游任务的实用性。针对这一空白,我们引入SynEval——一个开源评估框架,用于评估通过多样化评估指标生成的结构化表格数据的忠实性、实用性和隐私保护。我们通过将其应用于由三种最先进LLM(ChatGPT、Claude和Llama)生成的合成产品评论数据来验证所提出框架SynEval的有效性。我们的实验发现揭示了合成数据生成过程中各种评估指标之间的权衡。此外,SynEval是研究人员和从事结构化表格数据工作的实践者的关键工具,使他们能够在强调维护用户隐私的前提下,慎重确定生成数据的适用性。
引用
@article{arxiv.2404.14445,
title = {A Multi-Faceted Evaluation Framework for Assessing Synthetic Data Generated by Large Language Models},
author = {Yefeng Yuan and Yuhong Liu and Liang Cheng},
journal= {arXiv preprint arXiv:2404.14445},
year = {2025}
}
备注
10 pages, 1 figure, 4 tables