生成式搜索引擎中可验证性的评估
计算与语言
2023-10-25 v2 信息检索
摘要
生成式搜索引擎直接生成对用户查询的回复,并附以内联引用。可信生成式搜索引擎的一个先决特性是可验证性,即系统应全面地引用(高引用召回率;所有陈述均被引用充分支持)且准确地引用(高引用精确率;每条引用都支持其关联陈述)。我们开展人工评估,审计四种流行的生成式搜索引擎——Bing Chat、NeevaAI、perplexity.ai和YouChat——在来自多种来源的多样化查询集上的表现(例如历史Google用户查询、Reddit上动态收集的开放式问题等)。我们发现现有生成式搜索引擎的回复流畅且看似信息丰富,但频繁包含无支持的陈述和不准确的引用:平均而言,仅51.5%的生成句子被引用完全支持,且仅有74.5%的引用支持其关联句子。我们认为,对于可能作为信息寻求用户主要工具的系统而言,这些结果低得令人担忧,尤其考虑到其可信赖的外表。我们希望我们的结果能进一步激励可信生成式搜索引擎的开发,并帮助研究人员和用户更好地理解现有商业系统的缺陷。
引用
@article{arxiv.2304.09848,
title = {Evaluating Verifiability in Generative Search Engines},
author = {Nelson F. Liu and Tianyi Zhang and Percy Liang},
journal= {arXiv preprint arXiv:2304.09848},
year = {2023}
}
备注
25 pages, 12 figures; to appear in Findings of EMNLP 2023