基于KL松弛与策略梯度的可扩展双因果最优传输
最优化与控制
2026-05-19 v1 机器学习
摘要
双因果最优传输(Bi-causal optimal transport, OT)是一种在非预期信息约束下比较和耦合随机过程的自然框架,具有鲁棒金融、顺序不确定性定量和多阶段随机优化等重要应用。特别是,学习的双因果耦合自然作为生成既满足给定边际分布又满足信息流动规律的联合样本路径的模拟器。然而,其实际应用受限于在路径空间上强制执行双因果耦合约束的计算困难,尤其是针对连续分布和长时间范围。我们发展了一个用于计算一般边际分布下双因果OT耦合的可扩展随机优化框架。我们的ethods方法引入了Kullback--Leibler (KL) 罚函数松弛,将硬边际约束替换为可计算的散度惩罚,同时保持问题的递归结构。我们建立了原始和松弛形式的动态规划原理,证明了随着罚函数增大,松弛问题收敛于原始双因果OT问题,并推导了松弛目标的显式策略梯度表示。基于这些结果,我们提出了一种实用的策略梯度算法,具备无偏小批量估计、方差缩减和非渐近后悔保证。数值实验表明,该方法准确捕捉边际分布和时间依赖性,在包括鲁棒套期对冲和时间序列统计下采样等应用中表现良好。这些结果为双因果OT提供了可扩展的计算方法,拓宽了在非预期信息约束至关重要的情境下的适用性。
引用
@article{arxiv.2605.17271,
title = {Scalable Bi-causal Optimal Transport via KL Relaxation and Policy Gradients},
author = {Haoyang Cao and Jesse Hoekstra and Renyuan Xu and Yumin Xu and Ruixun Zhang},
journal= {arXiv preprint arXiv:2605.17271},
year = {2026}
}