中文

AmazonQAC:大规模自然化查询自动补全数据集

信息检索 2024-11-08 v1 人工智能 机器学习

摘要

查询自动补全(QAC)是现代搜索引擎的一项关键功能,通过根据输入前缀预测搜索查询来促进用户交互。尽管其应用广泛,但大规模真实数据集的缺失一直阻碍着 QAC 系统的发展。本文通过引入 AmazonQAC 来填补这一空白,该数据集源自 Amazon Search 日志,包含 3.95 亿条样本。数据集包含用户输入前缀到最终搜索词的实际序列,以及会话 ID 和时间戳,用于支持对 QAC 上下文依赖特性的建模。我们评估了前缀树、语义检索以及微调与未微调的大语言模型(LLM)。我们发现微调后的 LLM 表现最佳,尤其是在结合上下文信息时。然而,即使是我们最好的系统也只达到了我们在测试数据上计算出的理论可能值的一半,这表明 QAC 是一个极具挑战性的问题,现有系统远未解决这一难题。本研究旨在激发对 QAC 系统的进一步研究,以更好地服务于多样化环境中的用户需求。我们在 Hugging Face 上开源了该数据,地址为 https://huggingface.co/datasets/amazon/AmazonQAC。

关键词

引用

@article{arxiv.2411.04129,
  title  = {AmazonQAC: A Large-Scale, Naturalistic Query Autocomplete Dataset},
  author = {Dante Everaert and Rohit Patki and Tianqi Zheng and Christopher Potts},
  journal= {arXiv preprint arXiv:2411.04129},
  year   = {2024}
}

备注

EMNLP 2024