利用多源编码器-解码器模型从多文档生成共通问题
计算与语言
2019-10-28 v1
摘要
搜索引擎中模糊的用户查询会导致检索到的文档往往跨越多个主题。一个潜在的解决方案是搜索引擎生成多个细化查询,每个查询对应于跨越同一主题的文档子集。实现该目标的一个初步步骤是生成一个能捕捉多文档共通概念的问题。我们提出一项从多文档生成共通问题的新任务,并给出已有多源编码器-解码器框架的一个简单变体,称为多源问题生成器(MSQG)。我们首先从(单文档,问题)对训练一个基于 RNN 的单编码器-解码器生成器。在测试时,给定多文档,我们 MSQG 模型的“分发”步骤使用训练好的模型预测各文档的目标词分布。“聚合”步骤聚合这些分布以生成共通问题。这一简单而有效的策略在 MS-MARCO-QA 数据集上利用自动指标和人工评判进行评估时,显著优于应用于该新任务的若干现有基线模型。
引用
@article{arxiv.1910.11483,
title = {Generating a Common Question from Multiple Documents using Multi-source Encoder-Decoder Models},
author = {Woon Sang Cho and Yizhe Zhang and Sudha Rao and Chris Brockett and Sungjin Lee},
journal= {arXiv preprint arXiv:1910.11483},
year = {2019}
}
备注
Accepted at EMNLP-IJCNLP 2019 - The 3rd Workshop on Neural Generation and Translation