Crowd-SFT:面向 LLM 对齐的众包式监督微调
人机交互
2025-06-05 v1 分布式、并行与集群计算
机器学习
摘要
大型语言模型(LLM)越来越依赖监督微调(SFT)和基于人类反馈的强化学习(RLHF)来对齐模型响应与人类偏好。虽然 RLHF 采用强化学习方法并辅以独立的奖励模型,但 SFT 则使用人类精选数据集进行监督学习。这两种方法传统上都依赖于小规模的审稿组,导致成本高、易受偏好影响且难以扩展。我们提出一种开放的众包式微调框架,旨在通过无需 extensive annotator 培训来实现更广泛的反馈收集,从而克服上述局限性。该框架通过基于 Shapley 值的点-based 奖励系统实现激励公平,并通过迭代模型更新引导模型收敛。我们的多模型选择框架显示,与单模型选择相比,可实现目标距离降低最高达 55%,从而支持后续实验,验证我们基于点的奖励机制与 Shapley 值(一个用于归因 individual 贡献的成熟方法)高度一致,从而支持公平且可扩展的参与。
引用
@article{arxiv.2506.04063,
title = {Crowd-SFT: Crowdsourcing for LLM Alignment},
author = {Alex Sotiropoulos and Sulyab Thottungal Valapu and Linus Lei and Jared Coleman and Bhaskar Krishnamachari},
journal= {arXiv preprint arXiv:2506.04063},
year = {2025}
}