中文

微型语言模型实现即时响应

计算与语言 2026-04-22 v1

摘要

智能手表和智能眼镜等边缘设备由于功耗和算力限制,无法连续运行哪怕是最小的 100M-1B 参数语言模型,而云端推理引入的多秒级延迟破坏了响应式助手的错觉。我们引入了微型语言模型(μ\muLMs):超紧凑模型(8M-30M 参数),可在设备上即时生成上下文相关响应的前 4-8 个词,同时由云端模型完成剩余部分;从而掩盖云端延迟。我们表明,在这种极端规模下,有用的语言生成依然存在,我们的模型可媲美若干现有的 70M-256M 级模型。我们设计了一个协作生成框架,将云端模型重新定位为续写者而非响应者,实现了无缝的句中交接,并在本地开场模型出错时通过三种纠错方法进行结构化的优雅恢复。实证结果表明,μ\muLMs 可以启动响应,而由较大的模型无缝完成,证明了数量级不对称的协作是可实现的,为极度资源受限的设备解锁了响应式 AI。模型检查点和演示可在 https://github.com/Sensente/micro_language_model_swen_project 获取。

关键词

引用

@article{arxiv.2604.19642,
  title  = {Micro Language Models Enable Instant Responses},
  author = {Wen Cheng and Tuochao Chen and Karim Helwani and Sriram Srinivasan and Luke Zettlemoyer and Shyamnath Gollakota},
  journal= {arXiv preprint arXiv:2604.19642},
  year   = {2026}
}