学习何时信任:基于情境的置信区间学习
人工智能
2026-03-17 v1 机器学习
摘要
标准的鲁棒强化学习方法假设反馈来源要么在全局上可信,要么在全局上对抗。本文挑战了这一假设,我们识别出一种更为微妙的失效模式。我们称之为情境式随从(Contextual Sycophancy),即评估者在良性情境中诚实,但在关键情境中策略性偏颇。我们证明,标准鲁棒方法在此情境下会遭受情境目标脱钩(Contextual Objective Decoupling)。为此,我们提出CESA-LinUCB,通过为每个评估者学习高维信任边界(Trust Boundary)来应对这一挑战。我们证明CESA-LinUCB在面对情境对抗者时可实现亚线性 regret ,即使没有任何评估者全局可靠,仍能恢复真实结果。
引用
@article{arxiv.2603.13356,
title = {Learning When to Trust in Contextual Bandits},
author = {Majid Ghasemi and Mark Crowley},
journal= {arXiv preprint arXiv:2603.13356},
year = {2026}
}