大型语言模型中的“神经啸叫”:一种自强化偏差现象及动态衰减解决方案
计算与语言
2025-04-14 v1 人工智能
神经与进化计算
摘要
大型语言模型(LLM)驱动的 AI 系统可能会表现出一种我们称之为“神经啸叫”的推理失效模式,这是一种自强化认知循环,其中某些高权重输入占据主导地位,导致难以纠正的固化响应模式。本文探讨了这一现象背后的机制,该现象有别于模型崩溃和偏差显著性加权。我们提出了一种基于衰减的校正机制,该机制动态引入平衡性调整,即使在“锁定”的 AI 系统中也能恢复自适应推理。此外,我们讨论了由不当管理的强化引起的一些其他相关效应。最后,我们概述了这种缓解策略在改善真实世界决策任务中 AI 鲁棒性方面的潜在应用。
引用
@article{arxiv.2504.07992,
title = {'Neural howlround' in large language models: a self-reinforcing bias phenomenon, and a dynamic attenuation solution},
author = {Seth Drake},
journal= {arXiv preprint arXiv:2504.07992},
year = {2025}
}
备注
27 pages, 3 figures, 2 tables,