向右看有时是对的:探究仅解码器大语言模型在序列标注上的能力
计算与语言
2024-06-07 v3
摘要
基于掩码语言建模(MLM)的预训练语言模型在自然语言理解(NLU)任务中表现出色。虽然微调后的基于 MLM 的编码器在性能上持续优于同等规模的因果语言建模解码器,但最近的仅解码器大语言模型(LLMs)的性能与较小的基于 MLM 的编码器相当。尽管其性能随着规模扩大而提升,但 LLMs 在信息抽取(IE)任务中仍未能达到最先进的结果,其中许多任务被表述为序列标注(SL)。我们假设 LLMs 在 SL 上的不佳表现源于因果掩码,它阻止模型关注当前 token 右侧的 token。然而,LLMs 在 SL 上的性能究竟如何以及在多大程度上可以得到改善仍不清楚。我们探索了通过在 LLM 微调期间逐层移除因果掩码(CM)来提高开放 LLMs 在 IE 任务上的 SL 性能的技术。这种方法带来的性能提升可与最先进的 SL 模型相媲美,匹配或优于从所有块中移除 CM 的结果。我们的发现适用于多种 SL 任务,表明采用层依赖 CM 移除的开放 LLMs 优于强大的基于 MLM 的编码器,甚至优于经过指令微调的 LLMs。
引用
@article{arxiv.2401.14556,
title = {Looking Right is Sometimes Right: Investigating the Capabilities of Decoder-only LLMs for Sequence Labeling},
author = {David Dukić and Jan Šnajder},
journal= {arXiv preprint arXiv:2401.14556},
year = {2024}
}
备注
Accepted at ACL 2024 Findings