对抗性赌博机反馈下用于事实性控制的在线共形弃权
机器学习
2026-05-06 v4
摘要
随着交互式生成系统越来越多地部署于实际应用,其生成不可靠或错误回答的倾向引发了严重关切。共形弃权通过确保系统仅在确信时才回答来缓解此风险。然而,实际部署通常仅提供关于所选响应的部分用户反馈(例如,点赞/点踩),并且常常在非平稳或对抗性环境中运行,而有效的学习方法在很大程度上是缺失的。为弥补这一差距,我们提出了ExAUL,一个用于对抗性和部分反馈下共形弃权的新型在线学习框架。在技术上,我们引入了(i) 一个新颖的转换引理,将任何赌博机算法的遗憾转化为错误发现率界,以及(ii) 反馈解锁,一种利用共形弃权结构从部分反馈中提取额外学习信号的策略。我们证明ExAUL实现了的遗憾界,这转化为错误发现率风险控制的界,尽管仅接收部分反馈,仍匹配了全信息设置的可控性。虽然适用于一般生成任务,我们通过在多种非平稳和对抗性设置下的问答任务上进行实证验证,展示了ExAUL在确保大型语言模型可靠性方面的有效性。我们的结果表明,ExAUL在保持有竞争力的回答覆盖率的同时,稳健地控制了错误发现率。
引用
@article{arxiv.2506.14067,
title = {Online Conformal Abstention for Factuality Control Under Adversarial Bandit Feedback},
author = {Minjae Lee and Yoonjae Jung and Sangdon Park},
journal= {arXiv preprint arXiv:2506.14067},
year = {2026}
}
备注
11 pages