大语言模型的一个盲点:超叙事语言信息
计算与语言
2024-05-17 v3 人工智能
摘要
诸如 ChatGPT 之类的大语言模型(LLM)反映了人工智能领域的深刻变革,达到了令人印象深刻乃至震惊的、类人的语言流畅度。其当前与潜在能力的范围是一个活跃的研究领域,绝不仅限于科学研究人员。人们常将 LLM 的训练数据框定为“文本”甚至“语言”。我们借助包括语言学、具身认知、认知科学、数学与历史学在内的多个领域的观念,审视这一框定的细节。我们提出,考量如 ChatGPT 这样的 LLM 的“如之何感”(一如 Nagel 可能所言)有助于我们总体洞察其能力,特别地,其语言训练数据的暴露可富有成效地重框定为对语言中编码的叙事信息的暴露,而其缺陷可重框定为对包括超叙事语言信息在内的叙事外信息的无知。超叙事语言信息由语言物理形式的那些任意方面构成,它们无法从 ChatGPT 类 LLM 所能获取的上下文一维关系——频率、邻接、邻近、共现——推导而出。粗略而言,一个词的叙事部分可被视为其功能、意义,即词嵌入中理论向量的信息,而其超叙事部分可被视为其形式,如字母形状或音节声音。我们利用这些概念探究为何 ChatGPT 类 LLM 在处理回文、符号视觉特征、翻译苏美尔楔形文字与续写整数序列时存在困难。
引用
@article{arxiv.2306.06794,
title = {A blind spot for large language models: Supradiegetic linguistic information},
author = {Julia Witte Zimmerman and Denis Hudon and Kathryn Cramer and Jonathan St. Onge and Mikaela Fudolig and Milo Z. Trujillo and Christopher M. Danforth and Peter Sheridan Dodds},
journal= {arXiv preprint arXiv:2306.06794},
year = {2024}
}
备注
21 pages, 6 figures, 3 tables. Accepted at IC2S2 2024. arXiv admin note: text overlap with arXiv:2206.02608, arXiv:2303.12712, arXiv:2305.10601, arXiv:2305.06424, arXiv:1908.08530 by other authors