变形器架构的局限性
机器学习
2024-02-28 v2 人工智能
机器学习
摘要
大型语言模型(LLM)中幻觉的根本原因是什么?我们使用通信复杂性证明,变形器层在函数合成(例如识别人物在谱系中的祖父母)方面无法工作,如果函数的域足够大;我们通过实例表明,这种无法现象在域相当小时已经经验性地存在。我们还指出,several数学任务是所谓的组合任务的核心,这些任务被认为对LLM来说很难解决,但对于足够大的实例,假设计算复杂性领域的一些被广泛接受的猜想成立,这些任务不太可能由变形器解决。
关键词
引用
@article{arxiv.2402.08164,
title = {On Limitations of the Transformer Architecture},
author = {Binghui Peng and Srini Narayanan and Christos Papadimitriou},
journal= {arXiv preprint arXiv:2402.08164},
year = {2024}
}