中文

第一步最艰难:面向大语言模型的时间数据表示与分词陷阱

机器学习 2023-09-13 v1 计算与语言

摘要

大语言模型(LLMs)已在多样化任务中展现出显著的泛化能力,导致人们日益将其用作个人助手和通用计算引擎。然而,当将数值/时间数据(例如来自可穿戴设备或电子健康记录的数据)输入这些模型时,出现了一个显著障碍。LLMs 在其输入中使用分词器将文本拆分为更小的单元。然而,分词器并非为表示数值而设计,可能难以理解重复模式和上下文,将连续值视为独立词元并忽略其时间关系。在此,我们讨论近期将 LLMs 用于以人为中心任务(如移动健康感知)的工作,并给出一个案例研究,表明流行的 LLMs 对时间数据的分词不正确。为此,我们强调潜在的解决方案,例如带轻量嵌入层的提示微调以及多模态适配器,可帮助弥合这一“模态鸿沟”。尽管语言模型以最小或无需微调泛化到其他模态的能力令人振奋,但本文强调:若它们在输入细微之处跌跤,其输出便不可能有意义。

关键词

引用

@article{arxiv.2309.06236,
  title  = {The first step is the hardest: Pitfalls of Representing and Tokenizing Temporal Data for Large Language Models},
  author = {Dimitris Spathis and Fahim Kawsar},
  journal= {arXiv preprint arXiv:2309.06236},
  year   = {2023}
}

备注

Accepted at the Generative AI for Pervasive Computing Symposium (GenAI4PC) at UbiComp 2023