中文

公共人工智能信息服务中的策展检索与开放网络搜索:覆盖范围与信任度的权衡

计算机与社会 2026-07-06 v1 计算与语言 信息检索

摘要

公共机构越来越多地使用大型语言模型(LLM)来回答公民的问题,通常将策展的知识库与实时网络搜索相结合,然而这些答案背后的来源是否可信却很少受到实证审查。我们报告了Evrópuvefur的发布前专家评估,这是一项由冰岛大学运营的独立、政府资助的服务,负责回答关于欧盟的问题,评估是在冰岛准备2026年8月29日关于是否恢复欧盟入盟谈判的公投期间进行的。五位领域专家对449个AI生成的答案进行了551次评估,根据七项标准质量评分标准进行评分,并单独标记了引用的来源。我们比较了两种检索路径:策展的本地语料库(RAG)和开放网络搜索。在超过三分之一的已审查网络搜索答案中(35%,65/187),至少有一个引用的来源被标记,几乎总是不可信或不相关;策展来源被标记的频率要低得多,且仅因为过时。网络搜索回答了更多问题,但以来源质量为代价;策展语料库可信但覆盖范围有限,当不足时模型拒绝回答。引用组合也忽略了强有力的来源:在所有287个网络搜索答案中,系统从未引用RÚV,即公共广播公司和国家使用最广泛的新闻来源。一项配套的提示消融研究显示了提示级引导的薄弱:系统提示中的可信域列表仅将引用所列域的份额从12%提高到21%。流畅性和主题契合度并不能预测来源的可信度。我们认为,来源可信度是公共AI服务中信息质量的一个可衡量但很大程度上不可见的维度,并讨论了面向透明度的应对措施及其权衡。

关键词

引用

@article{arxiv.2607.05217,
  title  = {Curated retrieval versus open web search in public AI information services: a coverage-trust trade-off},
  author = {Hafsteinn Einarsson and Hafsteinn Birgir Einarsson and Jón Gunnar Ólafsson and Jón Gunnar Þorsteinsson},
  journal= {arXiv preprint arXiv:2607.05217},
  year   = {2026}
}