中文

数字人文领域关系抽取数据集及其基于词嵌入的评测

计算与语言 2023-10-04 v1

摘要

在本研究中,我们人工创建了数字人文领域的高质量数据集,用于评测语言模型,特别是词嵌入模型。第一步是为两部奇幻小说系列各创建两类任务(类比与不匹配)的unigram和n-gram数据集。随后,使用word2vec、GloVe、fastText或LexVec等多种流行词嵌入模型类型在两部分小说上训练模型。最后,我们在语料规模相对较小的情形下,评测词嵌入模型对于此类特定关系抽取任务的适用性。在评测中,我们还研究并分析了诸如语料词频与任务难度对准确率的影响等具体方面。该数据集以及底层系统与词嵌入模型已在github上公开,可轻松扩展新数据集与任务、用于复现所呈现的结果,或迁移至其他领域。

关键词

引用

@article{arxiv.1903.01284,
  title  = {Relation Extraction Datasets in the Digital Humanities Domain and their Evaluation with Word Embeddings},
  author = {Gerhard Wohlgenannt and Ekaterina Chernyak and Dmitry Ilvovsky and Ariadna Barinova and Dmitry Mouromtsev},
  journal= {arXiv preprint arXiv:1903.01284},
  year   = {2023}
}