中文

可纠正性作为单一目标:内在可靠基础模型的愿景

人工智能 2025-06-04 v1 计算机与社会 机器学习

摘要

基础模型面临一项关键的安全挑战:随着能力的扩展,工具性收敛驱动默认轨迹走向人类失控,最终可能导致生存灾难。当前的对齐方法在价值规范复杂性上存在困难,且未能解决涌现的权力寻求行为。我们提出“可纠正性作为单一目标”(CAST)——设计基础模型,使其首要目标是赋能指定的人类委托人去引导、纠正和控制它们。这种从静态价值加载到动态人类赋能的范式转变改变了工具性驱动:自我保存仅用于维持委托人的控制;目标修改转变为促进委托人引导。我们提出了一项全面的实证研究议程,涵盖训练方法(RLAIF、SFT、合成数据生成)、跨模型规模的扩展性测试,以及受控可指令性演示。我们的愿景是:随着能力的增长,基础模型对人类引导的响应越来越强,提供了一条通向有益 AI 的路径,使其尽可能保持工具属性,而不是取代人类判断。这从源头上解决了核心对齐问题,防止了走向未对齐的工具性收敛的默认轨迹。

关键词

引用

@article{arxiv.2506.03056,
  title  = {Corrigibility as a Singular Target: A Vision for Inherently Reliable Foundation Models},
  author = {Ram Potham and Max Harms},
  journal= {arXiv preprint arXiv:2506.03056},
  year   = {2025}
}

备注

Preprint. This work has been submitted to the Reliable and Responsible Foundation Models Workshop at ICML 2025 for review