中文

LPDP:基于编辑流的可变长度DNA生成推理时奖励控制

机器学习 2026-05-13 v1 人工智能 基因组学

摘要

我们研究了将最新的编辑流用于DNA序列生成推理时奖励控制的应用。不同于大多数面向固定长度序列空间的奖励引导DNA生成框架,编辑流有望通过生物学上合理的插入、删除和替代操作生成可变长度DNA。具体而言,我们提出了局部扰动离散规划(Local Perturbation Discrete Programming, LPDP),这是一种在推理时针对可变长度DNA编辑动作生成器的训练-free、中间状态和动作感知的局部重解决算子。在每个引导 rollout 步骤中,LPDP对一步根编辑进行评分,保留近最佳根带宽,并对每个保留的根进行重新排序,通过在其子序列周围解决一个受限的局部离散程序来实现。这一局部程序利用编辑动作的类型几何,聚焦于连贯的替代、插入或删除子图,并通过硬Max备份或软log-sum-exponential(LSE)备份聚合局部延续。我们在两个场景中实现了LPDP:一种是前置奖励倾斜,用于增强子激活器优化,其中早期编辑对建立全局调控序列结构至关重要;另一种是后置奖励倾斜,用于外显-内含子-外显子掩码,其中后期编辑微调剪接边界上下文。

关键词

引用

@article{arxiv.2605.11368,
  title  = {LPDP: Inference-Time Reward Control for Variable-Length DNA Generation with Edit Flows},
  author = {Jeongchan Kim and Yunkyung Ko and Jong Chul Ye},
  journal= {arXiv preprint arXiv:2605.11368},
  year   = {2026}
}

备注

22 pages, 5 figures