Trie-NLG:以 Trie 上下文增强改进短前缀与未见前缀下的个性化查询自动补全
计算与语言
2023-10-24 v2
摘要
查询自动补全(QAC)旨在为给定查询前缀建议合理的补全。传统上,QAC 系统利用从历史查询日志中构建的 trie 来建议最流行的补全。在此背景下,对任何 QAC 系统都难以处理的两类特定场景是:短前缀(其本身具有歧义性)与未见前缀。近来,个性化自然语言生成(NLG)模型被提出以利用先前会话查询作为上下文来解决这两类挑战。然而,此类 NLG 模型存在两个缺陷:(1)部分先前会话查询可能含噪声且与用户当前前缀意图无关;(2)NLG 模型无法直接纳入历史查询流行度。这促使我们提出一种用于 QAC 的新型 NLG 模型 Trie-NLG,其联合利用来自 trie 的流行度信号与来自先前会话查询的个性化信号。我们通过以由近期会话查询与 trie 热门补全构成的丰富上下文增强前缀来训练 Trie-NLG 模型。这一简单的建模方法克服了基于 trie 与基于 NLG 方法的局限,并取得了最先进的性能。我们使用两个大型 QAC 数据集评估 Trie-NLG 模型。平均而言,我们的模型在 MRR 上相较流行的基于 trie 的查找与强 BART 基线方法分别实现了约 57% 与约 14% 的巨大提升。我们公开了代码。
引用
@article{arxiv.2307.15455,
title = {Trie-NLG: Trie Context Augmentation to Improve Personalized Query Auto-Completion for Short and Unseen Prefixes},
author = {Kaushal Kumar Maurya and Maunendra Sankar Desarkar and Manish Gupta and Puneet Agrawal},
journal= {arXiv preprint arXiv:2307.15455},
year = {2023}
}
备注
ECML-PKDD 2023 (Journal Track)