用翻转语言建模揭示注意力故障
机器学习
2023-10-31 v2 计算与语言
摘要
为何大语言模型有时会输出事实性错误并表现出错误的推理?这些模型的脆弱性,特别是在执行长链推理时,目前似乎是其连贯地综合知识、语用与抽象思维等高级能力所必须付出的不可避免代价。为理解这一根本未解问题,本文识别并分析了注意力故障现象,即 Transformer 架构的归纳偏置间歇性失效,无法捕捉稳健推理。为隔离该问题,我们引入了翻转语言建模(FFLM),这是一个用于探查神经语言模型外推行为的合成基准参数族。这一简单的生成任务要求模型在忽略中间 token 的情况下,跨长程依赖复制二进制符号。我们发现 Transformer FFLM 存在长尾的偶发推理错误,其中部分可通过多种正则化技术消除。我们初步的机制分析揭示了剩余错误为何极难诊断与解决。我们假设注意力故障导致了自然 LLM 中(部分)封闭域幻觉。
引用
@article{arxiv.2306.00946,
title = {Exposing Attention Glitches with Flip-Flop Language Modeling},
author = {Bingbin Liu and Jordan T. Ash and Surbhi Goel and Akshay Krishnamurthy and Cyril Zhang},
journal= {arXiv preprint arXiv:2306.00946},
year = {2023}
}
备注
v2: NeurIPS 2023 camera-ready + data release