中文

延迟信息下的在线评分:一种凸优化视角

机器学习 2018-07-11 v1 机器学习

摘要

我们考虑一个系统,其中智能体以在线方式进入并基于其属性或上下文向量被评估。在实际中存在上下文被部分观测、未观测部分经过一定延迟才到达的情形。我们假设智能体一旦离开便不能重新进入系统。因此,系统的任务是基于智能体的即时得分以及对延迟得分上即时得分的某种推断,为其提供估计得分。在本文中,我们通过智能体与系统之间的在线凸博弈来估计延迟上下文。我们论证,若在线凸博弈的悔值较小,则经 TT 次迭代累积的得分估计误差也较小。进一步,我们利用延迟上下文与已知上下文之间相关函数形式的侧信息。我们考虑延迟固定或由对手任意选定的设定。此外,我们将公式推广至上下文取自某 Banach 空间的设定。总体而言,我们表明在决策时因不知延迟上下文而产生的平均惩罚随 O(1T)\mathcal{O}(\frac{1}{\sqrt{T}}) 缩放,在特殊设定下可改进至 O(logTT)\mathcal{O}(\frac{\log T}{T})

关键词

引用

@article{arxiv.1807.03379,
  title  = {Online Scoring with Delayed Information: A Convex Optimization Viewpoint},
  author = {Avishek Ghosh and Kannan Ramchandran},
  journal= {arXiv preprint arXiv:1807.03379},
  year   = {2018}
}

备注

8 pages, 4 figures