使用大型语言模型细化维基数据分类学
人工智能
2024-09-09 v1 计算与语言
信息检索
摘要
由于其协作性质,维基数据被认为拥有复杂的分类学,存在实例与类的模糊性、某些分类路径不准确、循环的存在以及跨类的高度冗余等问题。手动清理此类分类学耗时且容易出错或主观。我们提出了 WiKC,这是一个新的维基数据分类学版本,通过大型语言模型(LLMs)和图挖掘技术的结合自动清理实现。通过对开源大型语言模型进行零样本提示,执行分类学上的操作,如切断链接或合并类别。从内在和外在两个角度评估了精炼后分类学的质量,后者的一个实体类型任务表明了 WiKC 的实际价值。
引用
@article{arxiv.2409.04056,
title = {Refining Wikidata Taxonomy using Large Language Models},
author = {Yiwen Peng and Thomas Bonald and Mehwish Alam},
journal= {arXiv preprint arXiv:2409.04056},
year = {2024}
}
备注
ACM International Conference on Information and Knowledge Management, Oct 2024, Boise, Idaho, United States