BanglaAutoKG: 基于语义神经图过滤的自动 Bangla 知识图谱构建
计算与语言
2024-06-06 v3 信息检索
机器学习
神经与进化计算
社会与信息网络
摘要
知识图谱 (KGs) 在信息处理与推理应用中已被证明是不可或缺的,因为它们链接相关实体并提供上下文丰富的信息,支持高效的信息检索与知识发现;以非常有效的方式呈现信息流。尽管在全球范围内被广泛使用,由于缺乏全面的数据集、编码器、NER (命名实体识别) 模型、POS (词性标注) 工具和词形还原工具,Bangla 在 KGs 中的代表性相对较低,阻碍了该语言中高效的信息处理与推理应用。为了解决 Bangla 知识图谱匮乏的问题,我们提出了 BanglaAutoKG,这是一个能够从任何 Bangla 文本自动构建 Bangla 知识图谱的开创性框架。我们利用多语言 LLMs 理解各种语言,并普遍地关联实体与关系。通过使用翻译词典识别英文对应词,并从预训练的 BERT 模型中提取词特征,我们构建了基础 KG。为了降低噪声并使词嵌入与我们的目标对齐,我们采用了基于图的多项式滤波器。最后,我们实现了一个基于 GNN 的语义过滤器,它提升了上下文理解并修剪了不必要的边,最终形成确定的 KG。实证结果与案例研究表明了我们模型的普适有效性,能够从任何文本中自主构建语义丰富的 KGs。
引用
@article{arxiv.2404.03528,
title = {BanglaAutoKG: Automatic Bangla Knowledge Graph Construction with Semantic Neural Graph Filtering},
author = {Azmine Toushik Wasi and Taki Hasan Rafi and Raima Islam and Dong-Kyu Chae},
journal= {arXiv preprint arXiv:2404.03528},
year = {2024}
}
备注
7 pages, 3 figures. Accepted to LREC-COLING 2024. Read in ACL Anthology: https://aclanthology.org/2024.lrec-main.189/