面向无限维函数回归的情境化在线决策
机器学习
2025-01-31 v1 机器学习
摘要
情境化序列决策问题在机器学习中发挥着关键作用,涵盖诸多下游应用,如多臂老板板、序列假设检验和在线风险控制等。这些应用通常需要不同的统计度量,包括期望、方差和分位数。本文提供了一个通用的可接受算法框架,用于处理各种情境化在线决策问题,直接学习整个潜在未知分布,而不仅仅是关注 individual statistics。这一目标比起学习单个统计量要困难得多,因为回归的维数是不可数无限的,任何现有的线性情境多臂老板板算法都会导致无限 regret。为克服这一困难,我们提出了一个高效的无限维函数回归 oracle,用于情境累积分布函数(CDF),其中每个数据点都建模为 context-dependent CDF 基函数的组合。我们的分析揭示了设计积分算子特征值序列的衰减速率决定回归误差率,从而决定实用 regret 率。具体而言,当特征值序列呈现 的多项式衰减时,实用 regret 受到 的上界。当 时,这会恢复情境多臂老板板的现有最优 regret 率,并在更强的指数衰减假设下保持最优。此外,我们提供了一种数值方法来计算积分算子的特征值序列,从而实现本框架的实际应用。
引用
@article{arxiv.2501.18359,
title = {Contextual Online Decision Making with Infinite-Dimensional Functional Regression},
author = {Haichen Hu and Rui Ai and Stephen Bates and David Simchi-Levi},
journal= {arXiv preprint arXiv:2501.18359},
year = {2025}
}
备注
30 pages