俄语长文本分析基准
计算与语言
2024-08-06 v1 人工智能
摘要
近期自然语言处理(NLP)的进展推动了大型语言模型(LLM)的发展,这些模型能够解决广泛的各种任务。其关键应用方面之一是其处理长文本文档和处理长序列标记的能力。这已为对长上下文理解的正式评估需求。为满足俄语语言的这一需求,我们提出 LIBRA(Long Input Benchmark for Russian Analysis),该基准包含 21 个经过调整的数据集,用于研究 LLM 理解长文本的能力。测试分为四个复杂性组,并允许在上下文长度从 4k 到 128k 标记之间对模型进行评估。我们提供开源数据集、代码库和公开排行榜,以指导后续研究。
引用
@article{arxiv.2408.02439,
title = {Long Input Benchmark for Russian Analysis},
author = {Igor Churin and Murat Apishev and Maria Tikhonova and Denis Shevelev and Aydar Bulatov and Yuri Kuratov and Sergej Averkiev and Alena Fenogenova},
journal= {arXiv preprint arXiv:2408.02439},
year = {2024}
}