维基数据查询日志数据集
计算与语言
2026-05-20 v2
摘要
我们提出维基数据查询日志 (Wikidata Query Logs, WDQL) 数据集,这是一个包含 335k 个问句-查询对的数据集,涵盖维基数据知识图谱。该数据集是现有类似格式最大维基数据数据集(约 11 倍)且不依赖模板生成查询。我们采用真实世界的 SPARQL 查询发送至维基数据查询服务,并为其生成自然语言问题。由于这些基于日志的查询经过匿名处理,往往无法返回结果,因此需要大量工作将其转换回有意义的 SPARQL 查询。为实现此目标,我们提出了基于智能体的方法,通过迭代反匿名、清洗和验证查询来实现此目标,同时生成对应的自然语言问题。我们展示了该数据集对训练问答方法的益处。所有 WDQL 资产及智能体代码均通过 https://github.com/ad-freiburg/wikidata-query-logs 在宽松许可证下公开。
引用
@article{arxiv.2602.14594,
title = {The Wikidata Query Logs Dataset},
author = {Sebastian Walter and Hannah Bast},
journal= {arXiv preprint arXiv:2602.14594},
year = {2026}
}
备注
Accepted for publication at SIGIR 2026