MuLD:多任务长文档基准
计算与语言
2025-10-20 v1 人工智能
摘要
NLP技术的惊人进展是由GLUE和SuperGLUE等多任务基准的发展推动的。虽然这些基准关注于一两个输入句子的任务,但在设计处理更长输入的高效技术方面已有令人振奋的工作。在本文中,我们提出MuLD:一个仅由超过10,000个词元的文档组成的新长文档基准。通过修改现有的NLP任务,我们创建了一个多样化的基准,要求模型成功建模文本中的长期依赖。我们评估了现有模型的表现,发现我们的基准比它们的“短文档”对应版本更具挑战性。此外,通过评估常规和高效Transformer,我们表明具有增加上下文长度的模型更能解决所呈现的任务,这表明未来这些模型的改进对于解决类似长文档问题至关重要。我们发布了基线数据和代码,以鼓励对高效NLP模型的进一步研究。
引用
@article{arxiv.2202.07362,
title = {MuLD: The Multitask Long Document Benchmark},
author = {G Thomas Hudson and Noura Al Moubayed},
journal= {arXiv preprint arXiv:2202.07362},
year = {2025}
}