中文

BloomIntent: 利用大语言模型生成的细粒度用户意图自动化搜索评估

人机交互 2025-09-24 v1 信息检索

摘要

如果100个人发出相同的搜索查询,他们可能有100个不同的目标。虽然现有以用户为中心的AI评估工作强调了将系统与细粒度用户意图相对齐的重要性,但当前的搜索评估方法难以表征和评估这种多样性。我们引入了BloomIntent,一种以用户为中心的搜索评估方法,该方法使用用户意图作为评估单元。BloomIntent首先基于用户属性分类法和信息搜寻意图类型,生成一组合理且细粒度的搜索意图。然后,BloomIntent利用大语言模型对每个意图的搜索结果进行自动评估。为了支持实际分析,BloomIntent将语义相似的意图进行聚类,并在结构化界面中总结评估结果。通过三次技术评估,我们表明BloomIntent生成了细粒度、可评估且现实的意图,并产生了可扩展的意图级满意度评估,与专家评估员达成了72%的一致率。在一项案例研究(N=4)中,我们表明BloomIntent支持搜索专家识别模糊查询的意图,发现未被满足的用户需求,并发现可操作的见解以改善搜索体验。通过从查询级评估转向意图级评估,BloomIntent重新构想了如何评估搜索系统——不仅评估性能,还评估其服务于众多用户目标的能力。

关键词

引用

@article{arxiv.2509.18641,
  title  = {BloomIntent: Automating Search Evaluation with LLM-Generated Fine-Grained User Intents},
  author = {Yoonseo Choi and Eunhye Kim and Hyunwoo Kim and Donghyun Park and Honggu Lee and Jinyoung Kim and Juho Kim},
  journal= {arXiv preprint arXiv:2509.18641},
  year   = {2025}
}

备注

Accepted to UIST 2025; 34 pages (including 18 pages of Appendix)