NextLevelBERT: 使用更高层次表示的掩码语言模型处理长文档
计算与语言
2024-06-14 v2
摘要
尽管(大型)语言模型在过去几年中有了显著改进,但由于底层注意力机制的二次缩放,它们仍然难以合理处理长序列(例如书籍中的序列)。为了解决这个问题,我们提出了NextLevelBERT,一个掩码语言模型,它不操作于token,而是操作于更高层次的语义表示(文本嵌入)。我们预训练NextLevelBERT来预测整个掩码文本块的向量表示,并在三类任务上评估所得文档向量的有效性:1)通过零样本文档嵌入的语义文本相似度,2)长文档分类,3)多项选择问答。我们发现,下一级掩码语言模型是处理长文档用例的有效技术,只要所需的语义信息细节水平不太精细,它可以胜过更大的嵌入模型。我们的模型和代码公开可用。
引用
@article{arxiv.2402.17682,
title = {NextLevelBERT: Masked Language Modeling with Higher-Level Representations for Long Documents},
author = {Tamara Czinczoll and Christoph Hönes and Maximilian Schall and Gerard de Melo},
journal= {arXiv preprint arXiv:2402.17682},
year = {2024}
}
备注
accepted at ACL 2024; camera-ready version; 9 pages