个人邮件搜索中的分离与注意力机制
信息检索
2019-11-25 v1 计算与语言
机器学习
摘要
在个人邮件搜索中,用户查询往往对检索邮件的不同方面施加不同要求。例如,查询“我最近去美国的航班”要求邮件同时基于文本内容与邮件文档的新近性进行排序,而其他如“病史”的查询则不对邮件新近性施加任何约束。近期用于个人邮件搜索的深度学习排序模型常将稠密数值特征(如文档年龄)与嵌入的稀疏特征(如 n-gram 嵌入)直接拼接。本文首先通过在合成数据集上的一组实验表明,稠密与稀疏特征的直接拼接并不能使深度神经排序模型达到最优搜索性能。为有效将稀疏与稠密邮件特征纳入个人邮件搜索排序,我们提出了一种新颖神经模型 SepAttn。SepAttn 首先构建两个独立神经模型分别从宽疏与稠密特征中学习,然后在预测层应用注意力机制由这两模型得出最终预测。我们在大规模邮件搜索数据集上进行了全面实验,证明我们的 SepAttn 模型相较基线模型一致提升了搜索质量。
引用
@article{arxiv.1911.09732,
title = {Separate and Attend in Personal Email Search},
author = {Yu Meng and Maryam Karimzadehgan and Honglei Zhuang and Donald Metzler},
journal= {arXiv preprint arXiv:1911.09732},
year = {2019}
}
备注
WSDM 2020