中文

SynthTextEval:用于高风险领域的合成文本数据生成与评估工具包

计算与语言 2025-11-04 v2

摘要

我们提出SynthTextEval,一款用于进行综合合成文本评估的工具包。大型语言模型(LLM)输出的流畅度已使合成文本在诸多应用中具有潜在可行性,例如在开发和部署AI系统于高风险领域中减少隐私违规的风险。然而,充分利用这一潜力,却需要在多个维度对合成数据进行原则性且一致的评估:其在下游系统中的实用性、这些系统的公平性、隐私泄露风险、与源文本之间的分布差异,以及来自领域专家的定性反馈。SynthTextEval允许用户对他们上传或使用工具包内置生成模块生成的合成数据在上述所有维度上进行评估。虽然我们的工具包可以针对任何数据运行,但我们强调其在两个高风险领域的数据集上的功能和有效性:医疗保健和法律。通过整合和标准化评估指标,我们旨在提高合成文本的可行性,从而改善AI开发中的隐私保护。

关键词

引用

@article{arxiv.2507.07229,
  title  = {SynthTextEval: Synthetic Text Data Generation and Evaluation for High-Stakes Domains},
  author = {Krithika Ramesh and Daniel Smolyak and Zihao Zhao and Nupoor Gandhi and Ritu Agarwal and Margrét Bjarnadóttir and Anjalie Field},
  journal= {arXiv preprint arXiv:2507.07229},
  year   = {2025}
}

备注

EMNLP 2025 System Demonstration