中文

无标注训练数据的神经重复问题检测

计算与语言 2020-09-22 v2 机器学习

摘要

在社区问答(cQA)中训练用于重复问题检测的神经模型需要大量标注问题对,而获取这些标注代价高昂。为最小化该成本,近期工作常使用替代方法,例如对抗域适应。本工作中,我们提出两种新方法:(1)自动生成重复问题,以及(2)利用问题的标题与正文进行弱监督。我们表明,尽管二者不需要任何标注数据,仍可获得改进的性能。我们提供了对流行训练策略的全面比较,这为在不同场景下如何最佳训练模型提供了重要见解。我们表明,我们所提出的方法在许多情况下更有效,因为它们能利用来自cQA论坛更大量的未标注数据。最后,我们还表明,我们所提出的利用问题标题与正文信息进行弱监督的方法,也是一种无需直接答案监督来训练cQA答案选择模型的有效方法。

关键词

引用

@article{arxiv.1911.05594,
  title  = {Neural Duplicate Question Detection without Labeled Training Data},
  author = {Andreas Rücklé and Nafise Sadat Moosavi and Iryna Gurevych},
  journal= {arXiv preprint arXiv:1911.05594},
  year   = {2020}
}

备注

Accepted as long paper at EMNLP-2019