捕捉 AI 的注意力:重复、幻觉、偏见及其它元素的物理学
人工智能
2025-04-08 v1 其他凝聚态物理
数学物理
math.MP
适应与自组织系统
物理与社会
摘要
我们从首原则推导 LLM 核心“魔法”(如 ChatGPT、Claude)的注意力头的物理理论。该理论允许对输出重复、幻觉和有害内容以及偏见(例如来自训练和微调)等突出 AI 挑战进行定量分析。其预测与大规模 LLM 输出保持一致。其两体形式暗示了为何 LLM 如此有效,但也暗示了更广泛的三体注意力会让此类 AI 工作得更好。其类似于自旋浴,表明现有的物理学知识可以立即被利用以帮助社会确保 AI 可信且抗操纵。
引用
@article{arxiv.2504.04600,
title = {Capturing AI's Attention: Physics of Repetition, Hallucination, Bias and Beyond},
author = {Frank Yingjie Huo and Neil F. Johnson},
journal= {arXiv preprint arXiv:2504.04600},
year = {2025}
}
备注
Comments welcome to [email protected]