中文

从语言反馈中可证学习

机器学习 2025-06-13 v1 计算与语言

摘要

交互式地从观察和语言反馈中学习是一个日益受到关注的领域, driven by 大型语言模型(LLM)代理的出现。尽管已展示出惊人的实证成果,但迄今为止缺乏对这些决策问题的原则性框架。在本文中,我们正式化了来自语言反馈的学习(Learning from Language Feedback, LLF)问题,阐明了在潜在奖励下实现学习的充分假设条件,并引入transfer eluder dimension 作为 LLF 问题的复杂度度量。我们表明,transfer eluder dimension 捕捉了语言反馈改变 LLF 问题学习复杂度的直观意义。我们展示了从丰富的语言反馈中学习可比从奖励中学习更快地学习的情形。我们开发了一个 no-regret 算法,称为HELiX(HELiX\texttt{HELiX}),通过顺序交互 provably 求解 LLF 问题,性能保证随着 transfer eluder dimension 的规模而扩展。跨越多个实证领域,我们表明即使反复提示 LLM 不可靠时,HELiX 仍表现良好。我们的贡献标志着迈向从通用语言反馈中设计原则性交互式学习算法的第一步。

关键词

引用

@article{arxiv.2506.10341,
  title  = {Provably Learning from Language Feedback},
  author = {Wanqiao Xu and Allen Nie and Ruijie Zheng and Aditya Modi and Adith Swaminathan and Ching-An Cheng},
  journal= {arXiv preprint arXiv:2506.10341},
  year   = {2025}
}