中文

分层危险抽样:用于 CTMC/DTMC 离散扩散和流模型的最低方差事件调度

机器学习 2026-02-18 v2 计算与语言

摘要

均匀噪声离散扩散和流模型(如 D3PM、SEDD、UDLM、DFM)通过迭代细化随机初始化的词汇标记来生成序列,这些标记通过多次上下文依赖替换进行重排。这些模型通常形式化为时间非齐次的 CTMC/DTMC 过程,并使用每个离散步骤的独立伯硬利实验来采样。这导致每位置跳跃计数呈泊松-二项分布,随所需编辑次数的增加而增大,从而导致特征下编辑(残余噪声)和过度编辑(级联替换)失效模式,尤其是在紧张离散预算下会降低样本质量。相比之下,吸收态(掩码起始)模型通过允许每个位置最多跳跃一次来避免这种不稳定性。我们提出分层危险抽样(SHS),这是一种无需训练、即插即用且无需调参的推断原则,可用于任何接受停留与替换分解的采样器。SHS 将每个标记的编辑视为由累积危险(CTMC)或累积跳跃质量(DTMC)驱动的事件,并通过对累积量进行分层来安置事件:每个位置仅生成一个随机相位,当其累积危险跨越单位间隔阈值时,即可更新该标记。此举在保持预期跳跃次数不变的同时,实现了在无偏整数估计器中可能的最小条件方差(任何固定累积质量的下界为 1/4),而无需改变每个跳跃目的地的抽样,从而保留多模态性。在均匀噪声离散扩散语言模型上的实验表明,SHS 一致改善了样本质量。我们进一步表明,SHS 在基于标记的黑名单过滤中提高了鲁棒性,随着词汇约束日益严格,益处也随之增大。

关键词

引用

@article{arxiv.2601.02799,
  title  = {Stratified Hazard Sampling: Minimal-Variance Event Scheduling for CTMC/DTMC Discrete Diffusion and Flow Models},
  author = {Seunghwan Jang and SooJean Han},
  journal= {arXiv preprint arXiv:2601.02799},
  year   = {2026}
}

备注

Work in progress. Feedback welcome