中文

用于处理长文档的全局记忆 Transformer

计算与语言 2022-12-06 v1 机器学习

摘要

各类 Transformer 变体在不同自然语言处理任务(如翻译、阅读理解与摘要)中占据主导地位。本文更侧重于向输入添加通用记忆槽并研究添加这些槽后的结果。本文是对先前工作中提出模型输入所添加通用记忆槽规则的进一步研究。我们有两项主要任务:1)使用掩码语言建模的预训练任务;2)使用 HotpotQA 的微调任务。本研究旨在验证所提模型将多个分块当作一个分块处理的能力,并与基线模型比较。我们以 T5 transformer 为基线。我们研究了增强至每个输入分块的记忆槽规则,并在无选择器的情形下研究了模型性能。我们发现,在特定训练参数下,向输入分块添加记忆有助于所提模型在掩码语言建模任务上超越基线。消融研究揭示了使用压缩输入分块的能力,但性能有所下降。

关键词

引用

@article{arxiv.2212.01650,
  title  = {Global memory transformer for processing long documents},
  author = {Arij Al Adel},
  journal= {arXiv preprint arXiv:2212.01650},
  year   = {2022}
}

备注

10 pages, 4 figures, 5 tables. Published in neuroinformatics 2022