TWEETQA:一个聚焦社交媒体的问答数据集
计算与语言
2019-07-16 v1
摘要
随着社交媒体日益普及,大量新闻与实时事件在其上被报道,开发自动化问答系统对于依赖实时知识的诸多应用的有效性至关重要。尽管先前的数据集集中于新闻和维基百科等正式文本的问答(QA),我们提出了首个面向社交媒体数据的大规模 QA 数据集。为确保所收集推文有用,我们仅采集记者用于撰写新闻文章的推文。随后我们请人工标注者基于这些推文撰写问题与答案。与 SQuAD 等其他答案属抽取式的 QA 数据集不同,我们允许答案为抽象式。我们展示两个近期提出且在正式文本上表现良好的神经模型在应用于我们的数据集时性能有限。此外,即便是微调后的 BERT 模型仍大幅落后于人类表现。因此我们的结果指向了针对社交媒体文本的改进 QA 系统的需求。
引用
@article{arxiv.1907.06292,
title = {TWEETQA: A Social Media Focused Question Answering Dataset},
author = {Wenhan Xiong and Jiawei Wu and Hong Wang and Vivek Kulkarni and Mo Yu and Shiyu Chang and Xiaoxiao Guo and William Yang Wang},
journal= {arXiv preprint arXiv:1907.06292},
year = {2019}
}
备注
ACL 2019