英语与阿拉伯语社区问答中的问题重排序
计算与语言
2016-10-19 v1
摘要
本文研究了应用于社区问答(community Question Answering)中学习重排序(re-rank)问题的不同类型特征的影响。我们在SemEval-2016任务3“社区问答”发布的两个数据集上测试了我们的模型。任务3针对英语和阿拉伯语的真实网络论坛。我们的模型包括词袋特征(BoW)、句法树核(TKs)、排序特征、嵌入(embeddings)以及机器翻译评估特征。据我们所知,结构核(structural kernels)几乎尚未应用于问题重排序任务,在该任务中它们必须建模释义关系。在英语问题重排序任务中,我们将我们的学习排序(L2R)算法与由Google生成的排序(GR)给出的强基线进行比较。结果表明:i)我们TK中使用的浅层结构对噪声数据足够鲁棒;ii)改进GR是可能的,但需要有效的BoW特征和TKs,以及在所用L2R算法中对GR特征的精确建模。在阿拉伯语问题重排序任务中,我们首次将树核应用于阿拉伯语句子的句法树。我们对两项任务的方法在SemEval-2016子任务B(英语)和D(阿拉伯语)上均获得了第二好的结果。
引用
@article{arxiv.1610.05522,
title = {Addressing Community Question Answering in English and Arabic},
author = {Giovanni Da San Martino and Alberto Barrón-Cedeño and Salvatore Romeo and Alessandro Moschitti and Shafiq Joty and Fahad A. Al Obaidli and Kateryna Tymoshenko and Antonio Uva},
journal= {arXiv preprint arXiv:1610.05522},
year = {2016}
}
备注
presented at Second WebQA workshop, SIGIR2016 (http://plg2.cs.uwaterloo.ca/~avtyurin/WebQA2016/)