在内存受限下小型字符模型媲美大型词模型用于自动补全
计算与语言
2023-06-09 v2
摘要
自动补全(autocomplete)是一项任务,用户输入一段称为提示(prompt)的文本,模型以该提示为条件生成语义连贯的续写。现有该任务的工作主要集中于具有高频用户提示模式(或聚焦提示)的数据集(如电子邮件、聊天),其中基于词的语言模型已相当有效。在本工作中,我们研究更具挑战性的开放域设定,其包含低频用户提示模式(或宽泛提示,例如关于第93届奥斯卡金像奖的提示),并证明了基于字符的语言模型的有效性。我们在内存受限设定(如边缘设备和智能手机)下研究此问题,其中字符表示可有效减小整体模型规模(以参数量计)。我们使用 WikiText-103 基准来模拟宽泛提示,并证明在控制模型大小的情况下,字符模型在自动补全任务的精确匹配准确率上可与词模型匹敌。例如,我们展示一个 20M 参数的字符模型在原始设定下表现类似于一个 80M 参数的词模型。我们进一步提出新方法,通过引入组合信息和来自大型词模型的表示迁移作为归纳偏置来改进字符模型。本工作中使用的数据集和代码可在 https://github.com/UBC-NLP/char_autocomplete 获取。
引用
@article{arxiv.2210.03251,
title = {Small Character Models Match Large Word Models for Autocomplete Under Memory Constraints},
author = {Ganesh Jawahar and Subhabrata Mukherjee and Debadeepta Dey and Muhammad Abdul-Mageed and Laks V. S. Lakshmanan and Caio Cesar Teodoro Mendes and Gustavo Henrique de Rosa and Shital Shah},
journal= {arXiv preprint arXiv:2210.03251},
year = {2023}
}
备注
SustaiNLP 2023