标记、被忽视的开胃菜:大语言模型、分布性假设与意义
计算与语言
2025-11-25 v9 人工智能
摘要
标记是当前许多语言模型架构中必需的组成部分,包括基于 Transformer 的生成式 AI 大语言模型 (LLM),但其对模型认知的影响往往被忽视。我们认为 LLM 表明分布性假设 (DH) 对实现相当符合人类水平的语言性能(尤其是在推断词汇能力方面)是足够的,并且人类可理解语言单位在标记中以及当前结构约束的出现促使对现有对语言不敏感的标记技术进行更改,特别是就其作为 (1) 传递人类语言中关键分布模式给模型的载体以及 (2) 语义原语的角色而言。我们从 BPE 标记器;来自 Hugging Face 和 tiktoken 的现有模型词汇表;以及在 RoBERTa (large) 模型的层中移动的示例标记向量的信息入手。除了创建次优的语义构建块并遮蔽模型获取必要分布模式的能力之外,我们描述了标记和预训练如何作为偏见及其他不愿意内容的后门,而当前的对齐实践可能无法修复。此外,我们 relay 证据表明,标记算法的目标函数对 LLM 的认知具有影响,尽管其可能在主要系统智能方面被认为是有意义上独立的。最后,我们讨论了对架构选择、意义构建、语言思维的首要性以及 LLM 认知的影响。[First uploaded to arXiv in December, 2024.]
引用
@article{arxiv.2412.10924,
title = {Tokens, the oft-overlooked appetizer: Large language models, the distributional hypothesis, and meaning},
author = {Julia Witte Zimmerman and Denis Hudon and Kathryn Cramer and Alejandro J. Ruiz and Calla Beauregard and Ashley Fehr and Mikaela Irene Fudolig and Bradford Demarest and Yoshi Meke Bird and Milo Z. Trujillo and Christopher M. Danforth and Peter Sheridan Dodds},
journal= {arXiv preprint arXiv:2412.10924},
year = {2025}
}