基于关键词检测的稀疏变换器架构额外全局注意力设计
计算与语言
2024-10-14 v1
摘要
本文提出了一种对 Longformer Encoder-Decoder 架构的扩展,该架构是流行的稀疏变换器架构。稀疏变换器的一个常见挑战是它们在处理长程上下文编码时存在困难,例如文档开头和结尾之间话题之间的关联。本文提出了一种 selectively增加全局注意力的方法,并在多个基准数据集上的抽象摘要任务中进行演示。通过在 transcript 前缀添加额外关键词并对这些关键词进行全局注意力编码,本文在零样本、少样本和微调情况下的一些基准数据集上均展示了性能提升。
关键词
引用
@article{arxiv.2410.08971,
title = {Extra Global Attention Designation Using Keyword Detection in Sparse Transformer Architectures},
author = {Evan Lucas and Dylan Kangas and Timothy C Havens},
journal= {arXiv preprint arXiv:2410.08971},
year = {2024}
}