StoryDB:广泛的多语言叙事数据集
计算与语言
2022-11-15 v1
摘要
本文提出了 StoryDB——一个广泛的多语言叙事数据集。StoryDB 是一个文本语料库,包含 42 种不同语言的故事。每种语言包含 500 多个故事。部分语言包含超过 20000 个故事。每个故事都跨语言进行了索引,并标注了诸如体裁或主题等标签。该语料库展示了丰富的主题和语言多样性,可作为研究叙事在各种语言(包括低资源语言)的自然语言处理中作用的资源。我们还演示了如何使用该数据集对三个现代多语言模型(即 mDistillBERT、mBERT 和 XLM-RoBERTa)进行基准测试。
引用
@article{arxiv.2109.14396,
title = {StoryDB: Broad Multi-language Narrative Dataset},
author = {Alexey Tikhonov and Igor Samenko and Ivan P. Yamshchikov},
journal= {arXiv preprint arXiv:2109.14396},
year = {2022}
}