中文

基于互动的回溯学习

计算与语言 2025-05-22 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

大型语言模型(LLM)与用户之间的多轮互动天然包含隐式反馈信号。如果 LLM 对指令作出意外响应,用户可能会通过重新表述请求、表达不满或转向替代任务来表示这一点。此类信号是任务无关的,占据相对受限的语言子空间,这使得 LLM 即使在实际任务上失败,也能识别这些信号。我们引入 ReSpect(Retrospective Learning from Interactions,回溯学习方法),通过回溯方式从过去的互动中学习,而无需额外标注。在一个新的多模态互动场景中,人类指示多模态 LLM 解决一个具有组合解空间的抽象推理任务。通过与人类的数千次互动,我们展示了 ReSpect 如何从 31% 的任务完成率逐步提高到 82%,且完全不需要外部标注。

关键词

引用

@article{arxiv.2410.13852,
  title  = {Retrospective Learning from Interactions},
  author = {Zizhao Chen and Mustafa Omer Gul and Yiwei Chen and Gloria Geng and Anne Wu and Yoav Artzi},
  journal= {arXiv preprint arXiv:2410.13852},
  year   = {2025}
}