是什么让我们好奇?开放域问题语料库分析
计算与语言
2021-11-01 v1 人工智能
机器学习
摘要
人们每天通过智能设备或在线论坛提出简短问题,以寻求各类查询的答案。随着收集的问题数量增加,为每一个问题提供答案变得困难,这也是自动化问答兴趣日益增长的原因之一。有些问题与已有答案的重复,另一些则可由维基百科等外部知识源回答。一个重要的问题是,分析大量问题集能揭示什么。2017 年,布里斯托的 “We the Curious” 科学中心启动了一个项目以捕捉布里斯托市民的好奇心:该项目收集了超过 10,000 个关于各类主题的问题。由于收集时未给定规则,这些问题是真正的开放域,并横跨多种主题。该科学中心的一个重要目标是了解访客在科学之外所关切的内容,尤其是社会与文化议题。我们通过开发一种可用于执行多种处理任务的人工智能工具来解决这一问题:问题间等价性检测、主题与类型检测、以及问题回答。由于我们侧重于创建“通才”工具,我们使用来自不同数据集的标注数据对其进行训练。我们将所得模型称为 QBERT。本文描述了我们从对 WTC 开放域问题语料库的自动化分析中提取的信息。
引用
@article{arxiv.2110.15409,
title = {What makes us curious? analysis of a corpus of open-domain questions},
author = {Zhaozhen Xu and Amelia Howarth and Nicole Briggs and Nello Cristianini},
journal= {arXiv preprint arXiv:2110.15409},
year = {2021}
}