中文

ARES:基于交替强化学习与监督微调的多模态链式思考推理,通过多样化AI反馈实现提升

人工智能 2024-10-07 v2 计算与语言 机器学习

摘要

大型多模态模型(LMMs)在理解人类指令方面表现出色,跨越广泛的任务范围取得显著成果。强化学习从人类反馈(RLHF)和AI反馈(RLAIF)进一步细化大语言模型,通过与特定偏好相匹配来优化模型。这些方法主要使用基于排序的反馈来处理整个生成结果。随着先进的AI模型(如教师模型),例如GPT-4和Claude 3 Opus,我们可以请求各种详细反馈,这些反馈对人类而言成本较高。我们提出了两种阶段的算法ARES,该算法交替进行强化学习(RL)和监督微调(SFT)。首先,我们请求教师模型对链式思考(CoT)中每个句子对解决问题的贡献进行评分。这一句子级反馈允许我们考虑Individual有价值片段,为RL程序提供更细粒度的奖励。其次,我们要求教师模型在RL阶段纠正错误的推理。由于RL程序需要大量的超参数调优,常常会生成重复词汇和不完整句子等错误。通过纠错反馈,我们通过SFT稳定了RL微调模型。我们在多模型数据集ScienceQA和A-OKVQA上进行实验,以展示我们提议方案的有效性。ARES的理性推理在GPT-4o评审下约达到70%的优势。此外,我们观察到改进后的理性推理在多模态数据集上平均提高了2.5%的推理答案准确率。

关键词

引用

@article{arxiv.2407.00087,
  title  = {ARES: Alternating Reinforcement Learning and Supervised Fine-Tuning for Enhanced Multi-Modal Chain-of-Thought Reasoning Through Diverse AI Feedback},
  author = {Ju-Seung Byun and Jiyun Chun and Jihyung Kil and Andrew Perrault},
  journal= {arXiv preprint arXiv:2407.00087},
  year   = {2024}
}

备注

Accepted to EMNLP 2024