中文

基于机器学习与自然语言文本语义相似度度量及关键词感知交叉编码器排序摘要器——以 UCGIS GIS&T 知识体系为例

计算与语言 2023-05-18 v1 人工智能 信息检索

摘要

在大学地理信息科学联盟(UCGIS)的发起下,GIS&T 知识体系(BoK)是一项社区驱动的工作,旨在定义、开发并记录与地理信息科学技术(GIS&T)相关的地理空间主题。近年来,GIS&T BoK 在主题重组与内容更新方面经历了严格的发展,形成了该项目的新数字版本。尽管 BoK 主题为研究人员和学生提供了学习 GIS 的有用材料,但主题之间的语义关系(如语义相似度)也应被识别,以实现更好且自动化的主题导航。目前,相关主题或由编辑或作者手动定义,这可能导致对主题关系的不完整评估。为应对这一挑战,我们的研究评估了多种自然语言处理(NLP)技术在从文本中提取语义方面的有效性,包括深度神经网络与传统机器学习方法。此外,提出了一种新颖的文本摘要方法——KACERS(关键词感知交叉编码器排序摘要器,Keyword-Aware Cross-Encoder-Ranking Summarizer)来生成科学出版物的语义摘要。通过识别关键主题之间的语义联系,本工作为 GIS&T BoK 项目的未来开发与内容组织提供了指导。它也为利用机器学习技术分析科学出版物提供了新视角,并展示了 KACERS 摘要器在长文本文档语义理解中的潜力。

关键词

引用

@article{arxiv.2305.09877,
  title  = {Semantic Similarity Measure of Natural Language Text through Machine Learning and a Keyword-Aware Cross-Encoder-Ranking Summarizer -- A Case Study Using UCGIS GIS&T Body of Knowledge},
  author = {Yuanyuan Tian and Wenwen Li and Sizhe Wang and Zhining Gu},
  journal= {arXiv preprint arXiv:2305.09877},
  year   = {2023}
}