CQASUMM:构建社区问答摘要语料库的参考摘要
计算与语言
2018-11-13 v1
摘要
Quora、Stackoverflow 等社区问答论坛是丰富的知识资源,常提供主流搜索引擎忽略主题的信息。提交至这些论坛的答案常冗长、含垃圾内容、充斥辱骂与商业推广。读者难以浏览众多此类答案以把握社区观点。因此摘要成为社区问答论坛的优先任务。尽管已有诸多工作致力于事实型社区问答的摘要,非事实型社区问答摘要研究甚少。我们认为这源于缺乏足够大的带标注社区问答摘要数据集。我们通过筛选 440 万条 Yahoo! Answers L6 数据集,创建了 CQASUMM——首个大型标注社区问答摘要数据集。我们抽取最佳答案可兼作参考摘要的帖子,并据此构建百词摘要。我们将其他答案作为待摘要的候选文档。我们提供了生成该数据集的脚本,并引入了社区问答摘要这一新任务。多文档摘要已随新闻文章数据集被广泛研究,尤其在 DUC 与 TAC 挑战中使用了新闻语料。然而社区问答中的文档方差更大、观点相左且重叠更少。我们比较了流行的多文档摘要技术并评估其在我们的社区问答语料上的表现。我们考察了当前最优方法并理解了现有多文档摘要器(MDS)失效的情形。我们发现多数 MDS 流程为完全事实型新闻语料构建,而我们的语料也含相当比例的基于观点的实例。因此我们引入 OpinioSumm,一种新 MDS,其在 ROUGE-1 分数上以 4.6% 优于最佳基线。
引用
@article{arxiv.1811.04884,
title = {CQASUMM: Building References for Community Question Answering Summarization Corpora},
author = {Tanya Chowdhury and Tanmoy Chakraborty},
journal= {arXiv preprint arXiv:1811.04884},
year = {2018}
}
备注
Accepted in CODS-COMAD'19 , Jan 3-5, WB, India