面向稀疏与政策相关反馈的多层层次推断在线学习
机器学习
2026-03-05 v1 人工智能
摘要
层次化推断系统在多个计算层之间路由任务,其中每个节点可能要么在本地最终确定预测,要么将任务卸载到下一层的节点进行进一步处理。在此类系统中学习最优路由策略具有挑战性:推断损失在各层之间递归定义,而预测误差的反馈仅在终端 oracle 层公开。这导致该系统中呈现部分、与政策相关的反馈结构,其中可观测性概率随层级深度而衰减,使重要加权估计量因方差放大而不稳定。我们研究在长期资源约束和仅终端反馈条件下,对多层层次推断的在线路由。我们形式化了递归损失结构,证明了当反馈概率随层级衰减时,朴素的重要加权情境臂 bandit 方法会变得不稳定。为此,我们开发了一个集成 Lyapunov 优化的方差减小 EXP4 算法,实现无偏损失估计和在稀疏且与政策相关的反馈下保持学习稳定性。我们提供相对于 hindsight 中最佳固定路由策略的regret保证,并在随机到达和资源约束下建立近最优性。大规模多任务工作负载的实验表明,与标准重要加权方法相比,本方法在稳定性和性能方面均有所提升。
引用
@article{arxiv.2603.04247,
title = {Online Learning for Multi-Layer Hierarchical Inference under Partial and Policy-Dependent Feedback},
author = {Haoran Zhang and Seohyeon Cha and Hasan Burhan Beytur and Kevin S Chan and Gustavo de Veciana and Haris Vikalo},
journal= {arXiv preprint arXiv:2603.04247},
year = {2026}
}
备注
preprint