中文

基于人类比较的模型对齐概率方法

机器学习 2025-02-04 v2 机器学习

摘要

将人类知识整合到学习框架中,利用细微的人类反馈来改进 AI 模型,正成为一个不断增长的趋势。尽管这些方法在实践中显示出可喜的结果,但对其何时以及为何有效的理论理解仍然有限。本工作致力于发展一个理论框架,以分析人类比较能够增强传统监督学习过程的条件。具体而言,本文研究了带噪标签数据和人类比较数据的有效利用,以应对由噪声环境和高维模型带来的挑战。我们提出了一个两阶段的“监督学习+从人类反馈中学习”框架,通过概率二分法将机器学习与人类反馈联系起来。该两阶段框架首先通过监督学习过程从带噪标签数据中学习低维表示,然后利用人类比较来改进模型对齐。为了检验对齐阶段的有效性,我们引入了一个称为“标签噪声到比较准确率”比的概念。本文从理论角度确定了“SL+LHF”框架优于纯监督学习方法的条件;随后我们利用该 LNCA 比率来强调引入人类评估者在降低样本复杂度方面的优势。我们通过 Amazon Mechanical Turk (MTurk) 进行的案例研究验证了 LNCA 比率满足其使用所提出的条件。

关键词

引用

@article{arxiv.2403.10771,
  title  = {A Probabilistic Approach for Model Alignment with Human Comparisons},
  author = {Junyu Cao and Mohsen Bayati},
  journal= {arXiv preprint arXiv:2403.10771},
  year   = {2025}
}