中文

离散流匹配策略优化

机器学习 2026-04-09 v1 人工智能 计算工程、金融与科学

摘要

我们提出了离散流匹配策略优化(DoMinO),一个统一的框架,用于在广泛的策略梯度方法下对离散流匹配(DFM)模型进行强化学习(RL)微调。我们的核心思想是将DFM采样过程视为一个多步马尔可夫决策过程。这一视角为微调奖励最大化提供了一个简单透明的鲁棒RL目标重构。因此,它不仅保留了原始DFM采样器,还避免了许多先前RL微调方法中使用的有偏辅助估计量和似然代理。为防止策略崩溃,我们引入了新的总变差正则化器,以保持微调后的分布与预训练分布接近。理论上,我们建立了DoMinO的离散化误差上界以及正则化器的可处理上界。实验上,我们在调控DNA序列设计上评估了DoMinO。DoMinO在预测增强子活性和序列自然度方面优于先前最佳基于奖励的基线。正则化进一步改善了与自然序列分布的对齐,同时保持了强大的功能性能。这些结果确立了DoMinO作为可控离散序列生成的有用框架。

关键词

引用

@article{arxiv.2604.06491,
  title  = {Discrete Flow Matching Policy Optimization},
  author = {Maojiang Su and Po-Chung Hsieh and Weimin Wu and Mingcheng Lu and Jiunhau Chen and Jerry Yao-Chieh Hu and Han Liu},
  journal= {arXiv preprint arXiv:2604.06491},
  year   = {2026}
}