基于深度语义哈希的检索式聊天机器人超快低存储高效粗筛方法
计算与语言
2020-12-21 v2
摘要
我们研究检索式聊天机器人中的粗粒度选择模块。粗粒度选择是检索式聊天机器人中的基础模块,其从整个数据库中构建粗略候选集以加速与用户的交互。迄今为止,粗粒度选择模块有两类方法:(1) 稀疏表示;(2) 稠密表示。据我们所知,检索式聊天机器人中这两类方法尚无系统性对比,且哪类方法在真实场景中更优仍是开放问题。本文首先从四个方面系统性对比这两类方法:(1) 有效性;(2) 索引存储;(3) 搜索时间开销;(4) 人工评估。大量实验结果表明,稠密表示方法显著优于稀疏表示,但耗费更多时间与存储占用。为克服稠密表示方法的这些致命弱点,我们提出一种超快、低存储且高效的深度语义哈希粗粒度选择方法,称为 DSHC 模型。具体而言,在我们提出的 DSHC 模型中,一个由两个自编码器模型组成的哈希优化模块堆叠于训练好的稠密表示模型之上,并设计三个损失函数对其进行优化。哈希优化模块提供的哈希码有效保留了稠密向量中丰富的语义与相似度信息。大量实验证明,我们提出的 DSHC 模型相较稀疏表示可实现更快速度与更低存储,且与稠密表示相比性能损失有限。此外,我们的源代码已公开以供未来研究。
引用
@article{arxiv.2012.09647,
title = {Ultra-Fast, Low-Storage, Highly Effective Coarse-grained Selection in Retrieval-based Chatbot by Using Deep Semantic Hashing},
author = {Tian Lan and Xian-Ling Mao and Xiaoyan Gao and Wei Wei and Heyan Huang},
journal= {arXiv preprint arXiv:2012.09647},
year = {2020}
}