中文

捕捉 AI 的注意力:重复、幻觉、偏见及其它元素的物理学

人工智能 2025-04-08 v1 其他凝聚态物理 数学物理 math.MP 适应与自组织系统 物理与社会

摘要

我们从首原则推导 LLM 核心“魔法”(如 ChatGPT、Claude)的注意力头的物理理论。该理论允许对输出重复、幻觉和有害内容以及偏见(例如来自训练和微调)等突出 AI 挑战进行定量分析。其预测与大规模 LLM 输出保持一致。其两体形式暗示了为何 LLM 如此有效,但也暗示了更广泛的三体注意力会让此类 AI 工作得更好。其类似于自旋浴,表明现有的物理学知识可以立即被利用以帮助社会确保 AI 可信且抗操纵。

关键词

引用

@article{arxiv.2504.04600,
  title  = {Capturing AI's Attention: Physics of Repetition, Hallucination, Bias and Beyond},
  author = {Frank Yingjie Huo and Neil F. Johnson},
  journal= {arXiv preprint arXiv:2504.04600},
  year   = {2025}
}

备注

Comments welcome to [email protected]