中文

面向提高智能体的在线学习:多类、预算约束智能体与 bandit 学习者

机器学习 2026-02-20 v1 机器学习

摘要

我们研究了最近提出的改进学习模型,其中允许智能体对其特征值进行小幅修改以获得更理想的标签。我们广泛扩展了此模型中先前研究的结果,通过提供描述该模型中在线可学习性的组合维度,分析了多类设置,研究了在 bandit feedback 设置下的可学习性,建模了智能体进行改进所需的成本等。

关键词

引用

@article{arxiv.2602.17103,
  title  = {Online Learning with Improving Agents: Multiclass, Budgeted Agents and Bandit Learners},
  author = {Sajad Ashkezari and Shai Ben-David},
  journal= {arXiv preprint arXiv:2602.17103},
  year   = {2026}
}