中文

动态上下文演化用于可扩展的合成数据生成

计算与语言 2026-04-09 v1 人工智能 机器学习

摘要

大型语言模型在跨多个批次独立提示时会产生重复输出,这种现象我们称为跨批次模式崩溃:当语言模型在没有访问其先前生成内容的情况下被反复提示时,输出多样性的逐步丧失。从业者长期以来通过临时去重和种子轮换来缓解此问题,但尚无原则性框架。我们引入了动态上下文演化(DCE),包含三种机制:(1)语言化尾部采样(模型为每个想法标注一个关于其明显程度的猜测,明显想法被丢弃),通过模型自评估过滤高概率候选;(2)语义记忆,维护一个持久嵌入索引以跨批次拒绝近似重复项;以及(3)自适应提示演化,利用记忆状态和轮换多样性策略每批次重建生成提示。在三个领域(可持续包装概念、教育考试问题和创意写作提示)和两个模型族(gpt-5-mini 和 claude-haiku-4-5)上的实验中,每个方法 2-3 个随机种子的组件消融实验表明,DCE 实现了 0.0±0.0% 的崩溃,而朴素提示为 5.6±2.0%,同时每个种子产生 17-18 个 HDBSCAN 聚类,而朴素方法的 2-17 个波动聚类表明概念结构更丰富。这些结果通过独立嵌入模型(all-MiniLM-L6-v2)验证,并在 VTS 阈值 tau 和去重阈值 delta 的敏感性扫描中保持成立。去重和提示演化各自不充分但联合有效,仅使用标准 API 调用的成本约为每 1000 个候选 0.50 美元,无需微调或自定义架构。

关键词

引用

@article{arxiv.2604.07147,
  title  = {Dynamic Context Evolution for Scalable Synthetic Data Generation},
  author = {Ryan Lingo and Rajeev Chhajer},
  journal= {arXiv preprint arXiv:2604.07147},
  year   = {2026}
}