MFBE:利用FAQ多字段信息实现高效稠密检索
信息检索
2024-03-04 v2 机器学习
摘要
在 NLP 的问答领域,常见问题(FAQ)检索是一个重要的子领域,已被充分研究并针对多种语言展开工作。此处,针对用户查询,检索系统通常从知识库返回相关 FAQ。此类系统的效能取决于其实时建立查询与 FAQ 之间语义匹配的能力。由于查询与 FAQ 之间固有的词汇鸿沟、FAQ 标题缺乏充足上下文、标注数据稀缺以及高检索延迟,该任务颇具挑战。本工作中,我们提出一种基于双编码器的查询-FAQ 匹配模型,在模型训练与推理阶段均利用 FAQ 字段(如问题、答案与类别)的多种组合。我们提出的多字段双编码器(MFBE)模型受益于多 FAQ 字段带来的额外上下文,即便在极少标注数据下也表现良好。我们通过在无监督与有监督设定下对专有及开源公共数据集的实验实证支持该主张。相比最佳基线,我们的模型在内部与开放数据集的 FAQ 检索任务上分别实现了约 27% 与 20% 更优的 top-1 准确率。
引用
@article{arxiv.2302.11953,
title = {MFBE: Leveraging Multi-Field Information of FAQs for Efficient Dense Retrieval},
author = {Debopriyo Banerjee and Mausam Jain and Ashish Kulkarni},
journal= {arXiv preprint arXiv:2302.11953},
year = {2024}
}
备注
The first two authors contributed equally to this work. 12 pages, 3 figures, 5 tables. Accepted at the 2023 Pacific-Asia Conference On Knowledge Discovery And Data Mining (PAKDD)