科学文本意义的资讯空间
计算与语言
2020-04-30 v1 数字图书馆
摘要
在自然语言处理中,自动抽取文本意义是一个重要问题。我们关注短科学文本(摘要或简报)意义的计算分析。本文提出一种向量空间模型,用于量化词与文本的意义。我们引入意义空间,其中词的意义由关于文本所属学科类别的相对信息增益(RIG)向量表示,该向量可从文本中观测到该词获得。这一新方法被应用于基于Leicester Scientific Corpus(LSC)与Leicester Scientific Dictionary-Core(LScDC)构建意义空间。LSC是一个含1,673,350篇摘要的科学语料库,LScDC是一个从LSC提取词的科学词典。LSC中每篇文本属于Web of Science(WoS)的252个学科类别中至少一类。这些类别用于构建信息增益向量。意义空间针对LSC与LScDC进行了描述与统计分析。所提表示模型的效用通过每类中排名靠前的词评估。最具信息量的n个词被排序。我们证明基于RIG的词排序比基于原始词频的排序在判定词的科学特定意义与重要性上更有用。所提基于RIG的模型被证明具有在类别中凸显主题特定词的能力。最具信息量的词针对252个类别给出。新科学词典与103,998 x 252词-类别RIG矩阵可在线获取。意义空间的分析为我们提供了进一步探索使用更复杂且依赖上下文的意义模型(利用词共现及其组合)量化文本意义的工具。
引用
@article{arxiv.2004.13717,
title = {Informational Space of Meaning for Scientific Texts},
author = {Neslihan Suzen and Evgeny M. Mirkes and Alexander N. Gorban},
journal= {arXiv preprint arXiv:2004.13717},
year = {2020}
}
备注
320 pages