中文

内在的错位:大语言模型再现我们的双环学习盲点

人机交互 2025-07-04 v1

摘要

本文探讨了AI对齐问题中一个关键但尚未被探索的维度:大语言模型 (LLMs) 继承并放大人类信奉理论与使用理论之间现有错位的可能性。借鉴行动科学研究,我们认为在人类生成的文本上训练的 LLMs 可能会吸收并再现 Model 1 使用理论——一种防御性推理模式,它在二元、群体和组织层面上既抑制学习又创造持续的反学习动态。通过对一个担任人力资源顾问的 LLM 进行详细的案例研究,我们展示了其建议虽然表面上专业,但系统性地强化了非生产性的问题解决方法,并阻碍了更深层次组织学习的途径。这代表了AI对齐问题的一个具体实例,其中AI系统成功镜像了人类行为但继承了我们的认知盲点。如果将 LLMs 整合到组织决策过程中,这将带来特殊风险,可能在赋予其权威的同时巩固反学习实践。本文最后探讨了开发能够促进 Model 2 学习(一种更具生产性的使用理论)的 LLMs 的可能性,并指出这一努力可以同时推进AI对齐研究和行动科学实践。这一分析揭示了对齐挑战中一种意想不到的对称性:开发与人类价值观正确对齐的AI系统的过程,可能会产生帮助人类自身更好地体现这些相同价值观的工具。

关键词

引用

@article{arxiv.2507.02283,
  title  = {Misaligned from Within: Large Language Models Reproduce Our Double-Loop Learning Blindness},
  author = {Tim Rogers and Ben Teehankee},
  journal= {arXiv preprint arXiv:2507.02283},
  year   = {2025}
}

备注

21 pages