Large Concept Models: Language Modeling in a Sentence Representation Space
计算与语言
2024-12-17 v2
摘要
大语言模型(LLMs)已彻底改变了人工智能领域,并成为许多任务事实上的工具。当前 established technology of LLMs是在标记级别上处理输入并生成输出。这与人类在多个抽象层次之上(远远超出单个单词)来分析信息和生成创造性内容形成鲜明对比。在本文中,我们提出了一种 operate on explicit higher-level semantic representation的架构,该表示我们称为概念(concept)。概念是语言和模态无关的,代表流中的更高层次想法或动作。因此,我们构建了一个"大概念模型"。在本研究中,作为可行性证明,我们假设概念对应于句子,并使用支持文本和语音模态下最多200种语言的现有句子嵌入空间SONAR。Large Concept Model被训练以在嵌入空间中进行自回归句子预测。我们探索了多种方法,包括MSE回归、扩散基于生成的变体以及 operate in quantized SONAR空间的模型。这些探索使用16亿参数模型和约1.3万亿标记的训练数据进行。我们将一种架构扩展到70亿参数模型和约2.7万亿标记的训练数据。我们在几个生成任务上进行了实验评估,包括摘要生成和一种新的摘要扩展任务。最后,我们表明该模型在许多语言上展现出惊人的零样本泛化性能,超越了相同规模的现有LLM。该模型的训练代码已公开提供。
引用
@article{arxiv.2412.08821,
title = {Large Concept Models: Language Modeling in a Sentence Representation Space},
author = {LCM team and Loïc Barrault and Paul-Ambroise Duquenne and Maha Elbayad and Artyom Kozhevnikov and Belen Alastruey and Pierre Andrews and Mariano Coria and Guillaume Couairon and Marta R. Costa-jussà and David Dale and Hady Elsahar and Kevin Heffernan and João Maria Janeiro and Tuan Tran and Christophe Ropers and Eduardo Sánchez and Robin San Roman and Alexandre Mourachko and Safiyyah Saleem and Holger Schwenk},
journal= {arXiv preprint arXiv:2412.08821},
year = {2024}
}
备注
49 pages