基于签名变换的非线性与路径依赖性情景臂带问题
机器学习
2026-05-12 v1 最优化与控制
摘要
我们通过一种新颖的签名变换方法,研究非线性和路径依赖性情景臂带问题。利用签名的普遍非线性特性,我们用签名空间中的线性函数近似连续的路径依赖性奖励函数。这种表示方法使我们能够在保持表达式序列结构的同时,运用高效的线性情景臂带方法。基于此框架,我们提出 \texttt{DisSigUCB},一种基于签名的 disjoint 上置置信界(UCB)算法。在有界性和非退化假设下,我们证明了该算法具有高概率数据依赖性亚线性懊悼上界,阶数为 ,其中 d 为情景维度,m 为签名特征维度。通过合成实验以及温度传感器监控、睡眠阶段分类和医院护士排班等数值应用,实验结果表明 \texttt{DisSigUCB} 在非线性和路径依赖性情景下, consistently 优于经典线性和核化情景臂带基线方法。
引用
@article{arxiv.2605.10313,
title = {Signature Approach for Contextual Bandits with Nonlinear and Path-dependent Rewards},
author = {Xin Guo and Grace He and Xinyu Li},
journal= {arXiv preprint arXiv:2605.10313},
year = {2026}
}