通过大型和小型语言模型获取双向性
计算与语言
2024-12-11 v2
摘要
使用双向语言模型(如BERT)的token表示仍然是token分类任务中广泛使用的方法。尽管存在像Llama-2这样更大的单向LM,但它们很少被用来替代双向LM的token表示。在本工作中,我们假设它们缺乏双向性是导致其落后的原因。为此,我们提出了一种新方法:训练一个小型反向LM,并将其表示与现有LM的表示拼接,用于下游任务。通过命名实体识别的实验,我们证明引入反向模型可以将基准性能提升超过10个百分点。此外,我们证明所提出的方法在稀有领域和小样本学习设置中特别有效。
引用
@article{arxiv.2408.09640,
title = {Acquiring Bidirectionality via Large and Small Language Models},
author = {Takumi Goto and Hiroyoshi Nagao and Yuta Koreeda},
journal= {arXiv preprint arXiv:2408.09640},
year = {2024}
}
备注
Accepted by COLING2025