中文

基于实时噪声人类反馈的强化交互式持续学习

机器学习 2025-05-16 v1 人工智能

摘要

本文引入了一种交互式持续学习范式,使 AI 模型能够从实时人类反馈中动态学习新技能,同时保留先前知识。这一范式有别于传统持续学习的两个主要局限:(1)使用流式实时人工标注数据进行动态模型更新,而非具有固定标签的静态数据集;(2)假设标签干净,通过显式处理真实交互中常见的噪声反馈。为解决这些问题,本文提出 RiCL,即强化交互式持续学习框架,利用大型语言模型(LLM)从动态反馈中高效学习新技能。RiCL 包含三个关键组件:(1)时序一致性感知净化器,用于自动区分数据流中的干净样本和噪声样本;(2)交互感知的直接偏好优化策略,通过协调 AI 生成反馈与人类提供反馈来实现模型行为与人类意图的一致性;(3)抗噪声对比学习模块,利用内在数据关系捕获鲁棒表征,从而避免依赖可能不可靠的标签。在两个包含真实噪声模式的基准数据集(FewRel 和 TACRED)上的大量实验表明,RiCL 方法在现有最先进(SOTA)在线持续学习和噪声标签学习方法的组合上显著优于其他方法。

关键词

引用

@article{arxiv.2505.09925,
  title  = {Reinforced Interactive Continual Learning via Real-time Noisy Human Feedback},
  author = {Yutao Yang and Jie Zhou and Junsong Li and Qianjun Pan and Bihao Zhan and Qin Chen and Xipeng Qiu and Liang He},
  journal= {arXiv preprint arXiv:2505.09925},
  year   = {2025}
}