中文

AnswerSumm:用于答案摘要的人工标注数据集与处理流程

计算与语言 2022-05-02 v2

摘要

Stack Overflow 和 Yahoo! Answers 等社区问答(CQA)论坛包含了对广泛社区问题的丰富答案资源。每个问题线程可能收到大量具有不同视角的答案。答案摘要的一个目标是生成反映答案视角范围的摘要。该任务的主要障碍是缺乏提供此类摘要监督的数据集。近期工作提出启发式方法来创建此类数据,但这些数据往往含有噪声且不能覆盖所有存在的答案视角。本工作引入了一个由专业语言学家标注的、包含 4,631 个 CQA 线程的新型答案摘要数据集。我们的流程收集了答案摘要所有子任务的标注,包括相关答案句选择、基于视角对这些句子分组、对每个视角摘要以及生成总体摘要。我们在这些子任务上分析并基准测试了最先进的模型,并提出了一种用于多视角数据增强的新型无监督方法,根据自动评估可提升摘要性能。最后,我们提出强化学习奖励以改进事实一致性与答案覆盖度,并分析了可改进之处。

关键词

引用

@article{arxiv.2111.06474,
  title  = {AnswerSumm: A Manually-Curated Dataset and Pipeline for Answer Summarization},
  author = {Alexander R. Fabbri and Xiaojian Wu and Srini Iyer and Haoran Li and Mona Diab},
  journal= {arXiv preprint arXiv:2111.06474},
  year   = {2022}
}

备注

NAACL 2022; arXiv admin note: substantial text overlap with arXiv:2104.08536