基于自动机增强检索的神经符号语言建模
计算与语言
2022-06-10 v2 机器学习
摘要
基于检索的语言模型(R-LM)通过在测试时结合标准语言模型(LM)与从外部数据存储中检索的示例来建模自然语言文本的概率。尽管有效,这些模型在实际使用中的一个主要瓶颈是计算代价高昂的数据存储搜索,其执行频率可能高达每个时间步一次。本文提出 RetoMaton——检索自动机——它基于(1)在连续的数据存储条目间保存指针,以及(2)将条目聚类为“状态”来近似数据存储搜索。这有效地在数据存储之上构建了一个加权有限自动机,而非将数据存储表示为扁平列表。该自动机的创建是无监督的,且 RetoMaton 可由任意文本集合构建:无论是原始训练语料还是其他领域。在推理时遍历该自动机,并与 LM 推理并行,可将其困惑度降低多达 1.85,或者在不损害困惑度的情况下,相比 NN-LM(Khandelwal 等人,2020)节省多达 83% 的最近邻搜索。我们的代码与训练好的模型可在 https://github.com/neulab/retomaton 获取。
引用
@article{arxiv.2201.12431,
title = {Neuro-Symbolic Language Modeling with Automaton-augmented Retrieval},
author = {Uri Alon and Frank F. Xu and Junxian He and Sudipta Sengupta and Dan Roth and Graham Neubig},
journal= {arXiv preprint arXiv:2201.12431},
year = {2022}
}
备注
Accepted to ICML'2022. Code and models are available at https://github.com/neulab/retomaton