中文

人类监督作为信息瓶颈:人类引导学习误差底的统一理论

机器学习 2026-03-02 v1 人工智能

摘要

大型语言模型主要在人类生成的数据和反馈上进行训练,然而它们仍表现出源于标注噪声、主观偏好以及自然语言表达带宽有限而产生的持续性错误。我们认为,这些限制反映的是监督信道的结构属性,而非模型规模或优化过程。我们发展了统一理论,表明只要人类监督信道不足以满足潜在评估目标,它就作为一个信息减少的信道,导致被它支配的任何学习者都存在严格正数的剩余风险底。我们形式化了人类有限智能限制,展示了在六大互补框架(算子论、PAC-贝叶斯、信息论、因果推断、范畴论以及强化学习从人类反馈中的博弈论分析)中,非充分性导致相同的结构分解(标注噪声、偏好扭曲和语义压缩)产生严格正数的下界。该理论解释了为何仅靠规模扩张无法消除持续的人类对齐错误,并刻画了在辅助非人类信号(如检索、程序执行、工具)如何增加有效监督容量并通过恢复关于潜在目标的信息来消除底部的条件。实验在真实偏好数据、合成已知目标任务和外部可验证基准上,确认了预测的结构特征:仅人类监督表现出持续的底部,而充分信息的辅助信道严格降低或消除剩余误差。

关键词

引用

@article{arxiv.2602.23446,
  title  = {Human Supervision as an Information Bottleneck: A Unified Theory of Error Floors in Human-Guided Learning},
  author = {Alejandro Rodriguez Dominguez},
  journal= {arXiv preprint arXiv:2602.23446},
  year   = {2026}
}

备注

Proceedings from IEEE CAI 2026, Conference on Artificial Intelligence, 8-10 May, Granada, Spain. 8 Pages, 3 Figures, 7 Tables