中文

通过细粒度人设引导生成的合成数据词汇多样性测量

计算与语言 2025-09-22 v2

摘要

细粒度人设最近被用于为大型语言模型(LLM)的预训练和监督微调生成“多样性”合成数据。在本工作中,我们使用一套词汇多样性和冗余度指标衡量人设驱动的合成生成提示和响应的多样性。首先,我们发现合成提示/指令的多样性显著低于人类编写的提示。随后,我们从不同尺寸的LLM中采样响应,分别使用细粒度和粗糙人设描述,以探讨人设描述中细粒度细节对生成文本多样性的贡献。我们的结果表明,人设引导的生成比无人设引导的生成更具词汇多样性,尤其是在大型模型中。相比仅指定提示长度截断,添加细粒度人设细节对多样性贡献最小。

关键词

引用

@article{arxiv.2505.17390,
  title  = {Measuring Lexical Diversity of Synthetic Data Generated through Fine-Grained Persona Prompting},
  author = {Gauri Kambhatla and Chantal Shaib and Venkata Govindarajan},
  journal= {arXiv preprint arXiv:2505.17390},
  year   = {2025}
}

备注

Accepted to EMNLP Findings 2025