中文

MilkQA:面向答案选择任务的消费者问题数据集

计算与语言 2018-01-11 v1

摘要

我们介绍 MilkQA,一个来自乳制品领域的问答数据集,专门用于消费者问题的研究。该数据集包含 2,657 对问题与答案,以葡萄牙语写成,最初由巴西农业研究公司(Embrapa)收集。所有问题均由数千名背景与读写水平迥异的作者受真实情境激发而撰写,答案则由 Embrapa 客户服务的专家 elaborat 而成。我们的数据集由三名人类标注者进行过滤与匿名化。消费者问题是一种通常用作信息寻求形式的具有挑战性的问题。尽管已有若干问答数据集,但此类资源大多不适用于消费者问题答案选择模型的研究。我们旨在通过公开提供 MilkQA 来填补这一空白。我们研究了四种答案选择模型在 MilkQA 上的表现:两个基线模型与两个卷积神经网络架构。我们的结果表明,MilkQA 对计算模型提出了真实挑战,尤其因其问题的语言特征及其异常更长的长度。所尝试的模型中仅有一个给出合理结果,且以高计算需求为代价。

关键词

引用

@article{arxiv.1801.03460,
  title  = {MilkQA: a Dataset of Consumer Questions for the Task of Answer Selection},
  author = {Marcelo Criscuolo and Erick Rocha Fonseca and Sandra Maria Aluísio and Ana Carolina Sperança-Criscuolo},
  journal= {arXiv preprint arXiv:1801.03460},
  year   = {2018}
}

备注

6 pages