面向提高智能体的在线学习:多类、预算约束智能体与 bandit 学习者
机器学习
2026-02-20 v1 机器学习
摘要
我们研究了最近提出的改进学习模型,其中允许智能体对其特征值进行小幅修改以获得更理想的标签。我们广泛扩展了此模型中先前研究的结果,通过提供描述该模型中在线可学习性的组合维度,分析了多类设置,研究了在 bandit feedback 设置下的可学习性,建模了智能体进行改进所需的成本等。
引用
@article{arxiv.2602.17103,
title = {Online Learning with Improving Agents: Multiclass, Budgeted Agents and Bandit Learners},
author = {Sajad Ashkezari and Shai Ben-David},
journal= {arXiv preprint arXiv:2602.17103},
year = {2026}
}