中文

通过可扩展监督和集成学习改进弱到强泛化

计算与语言 2024-02-02 v1

摘要

本文是对OpenAI近期关于弱到强泛化(W2SG)的超对齐工作的后续研究。超对齐专注于确保高级AI系统在处理复杂、高风险任务时与人类价值观和意图保持一致。W2SG框架为这一不断发展的领域的实证研究开辟了新的可能性。我们的研究模拟了W2SG框架下的两个超对齐阶段:通用超人类模型的发展和向超级智能的推进。在第一阶段,基于人类监督,通过可扩展监督和集成学习的结合增强了弱监督的质量,缩小了弱教师与强学生之间的能力差距。在第二阶段,采用自动对齐评估器作为弱监督者。通过递归更新这个自动对齐器,弱教师模型的能力得到同步增强,实现了对更强学生模型的弱到强监督。我们还对所提方法的第一阶段进行了初步验证。以SciQ任务为例,我们通过装袋和提升探索了弱教师模型的集成学习。通过两种辅助设置探索可扩展监督:人机交互和AI-AI辩论。此外,论文还讨论了改进的弱监督对基于上下文学习的弱到强泛化的影响。实验代码和数据集将在https://github.com/ADaM-BJTU/W2SG发布。

关键词

引用

@article{arxiv.2402.00667,
  title  = {Improving Weak-to-Strong Generalization with Scalable Oversight and Ensemble Learning},
  author = {Jitao Sang and Yuhang Wang and Jing Zhang and Yanxu Zhu and Chao Kong and Junhong Ye and Shuyu Wei and Jinlin Xiao},
  journal= {arXiv preprint arXiv:2402.00667},
  year   = {2024}
}