从正确演示中学习作答
机器学习
2026-02-27 v2 人工智能
机器学习
摘要
我们研究学习生成问题(或提示)的答案(或补全)的问题,其中可能存在多个正确答案,在测试时任何一个都可以接受。学习基于每个训练问题的一些正确答案的演示,如同监督微调(SFT)。我们将该问题形式化为上下文赌博机中的模仿学习(即学徒学习),使用来自某个专家(最优或非常好)策略的离线演示,没有显式观测到的奖励。与先前假设演示者属于有界复杂度策略类的工作不同,我们提出仅依赖底层奖励模型(即指定哪些答案是正确的)属于有界复杂度类,我们认为这是一个严格更弱的假设。我们证明似然最大化方法在此设置中可能失败,并提出了一种方法,该方法学习到的作答能力几乎与演示者一样好,其样本复杂度相对于奖励类别的基数呈对数增长。我们的方法类似于 Syed 和 Schapire 2007 的方法(当适应于上下文赌博机(即单步)设置时),但是一种简单的单遍在线方法,具有“乐观速率”(即当演示者最优时为 ,而 Syed 和 Schapire 的方法为 ),并且即使使用任意自适应的演示也能工作。
引用
@article{arxiv.2510.15464,
title = {Learning to Answer from Correct Demonstrations},
author = {Nirmit Joshi and Gene Li and Siddharth Bhandari and Shiva Prasad Kasiviswanathan and Cong Ma and Nathan Srebro},
journal= {arXiv preprint arXiv:2510.15464},
year = {2026}
}
备注
Generalized some results. Updated the presentation in light of an important related work of Syed and Schapire. Improved discussions. Comments are welcome