中文

POIReviewQA:一个语义增强的 POI 检索与问答数据集

人工智能 2018-10-08 v1 计算与语言 信息检索

摘要

许多针对兴趣点(POI)执行信息检索的服务采用基于 Lucene 并结合空间过滤的设置。虽然此类系统易于实现,但其未利用语义,而是依赖查询与评论之间的直接词匹配,导致准确率和召回率均有所损失。为研究从非结构化数据中语义增强 POI 以支持开放域搜索和问答(QA)这一挑战性任务,我们引入了一个新数据集 POIReviewQA。它包含针对 1022 种 Yelp 商业类型的 2 万个问题(例如“这家餐厅允许带狗吗?”)。对于每个问题,我们抽样了 10 条评论,并标注了评论中每个句子是否回答该问题以及相应的答案。为测试系统理解文本的能力,我们采用信息检索评估,基于句子回答该问题的可能性对所有评论句子进行排序。我们构建了一个基于 Lucene 的基线模型,其达到 77.0% 的 AUC 和 48.8% 的 MAP。一个基于句子嵌入的模型达到 79.2% 的 AUC 和 41.8% 的 MAP,表明该数据集为 GIR 社区的未来研究提出了一个具有挑战性的问题。所得技术可帮助利用网络文档和社交媒体的主题内容来刻画地点特征。

关键词

引用

@article{arxiv.1810.02802,
  title  = {POIReviewQA: A Semantically Enriched POI Retrieval and Question Answering Dataset},
  author = {Gengchen Mai and Krzysztof Janowicz and Cheng He and Sumang Liu and Ni Lao},
  journal= {arXiv preprint arXiv:1810.02802},
  year   = {2018}
}