中文

基于关键词的序列到序列学习用于高效 FAQ 检索

信息检索 2021-08-24 v1

摘要

常见问题(FAQ)检索为响应用户基于自然语言的查询提供了一种有效流程。此类平台正日益普遍地应用于企业聊天机器人、产品问答以及面向客户的初步技术支持。然而,此类场景的挑战在于弥合多样化查询表述与对应答案之间的词汇与语义鸿沟,而二者通常篇幅都很短。本文提出 TI-S2S,一种结合基于 TF-IDF 的关键词提取与 Word2Vec 嵌入来训练序列到序列(Seq2Seq)架构的新型学习框架。它通过更好地理解由代表性关键词捕获的用户问题潜在意图,实现了 FAQ 检索的高精度。我们进一步提出一种变体,其带有额外的神经网络模块,通过基于相似度特征的相关候选识别来引导检索。在公开可用数据集上的实验表明,我们的方法在 rank-5 精度上达到约 92%,较现有方法提升近 13%。

关键词

引用

@article{arxiv.2108.10019,
  title  = {Sequence-to-Sequence Learning on Keywords for Efficient FAQ Retrieval},
  author = {Sourav Dutta and Haytham Assem and Edward Burgin},
  journal= {arXiv preprint arXiv:2108.10019},
  year   = {2021}
}

备注

6 pages