一种新的文本概念多样性度量方法
计算与语言
2023-12-29 v1 人工智能
信息论
math.IT
摘要
一个词可能包含一个或多个隐藏概念。虽然“动物”这个词在我们脑海中唤起许多图像并包含许多概念(鸟、狗、猫、鳄鱼等),但“鹦鹉”这个词唤起单一图像(一种有彩色羽毛、短而钩状的喙并能模仿声音的鸟)。在口语或书面文本中,我们有些词用于一般意义,有些用于详细指向特定对象。到目前为止,文本的概念多样性值无法使用标准且精确的技术确定。这项研究通过提供一种标准化方法和通用度量来评估和比较不同文本和领域中的概念多样性,为人工智能的自然语言处理领域做出了贡献。它也有助于语言的语义研究。如果我们给出两个句子的多样性分数示例,“他发现了一个未知实体”具有较高的概念多样性分数(16.6801),而“内质网在真核细胞的细胞质内形成一系列扁平囊泡”句子的概念多样性分数较低,为3.9068。
引用
@article{arxiv.2312.16548,
title = {A proposed new metric for the conceptual diversity of a text},
author = {İlknur Dönmez Phd and Mehmet Haklıdır Phd},
journal= {arXiv preprint arXiv:2312.16548},
year = {2023}
}
备注
13 pages, 2 graphical figures, 3 algorithm figures