分析LLM驱动对话AI系统中的参考文献的呈现、内容与利用
人机交互
2026-04-20 v1
摘要
随着对话式AI系统在信息检索和问答方面的流行,他们引用的参考文献对于确保答案的可靠性和可信度至关重要。然而,尚无先前工作系统性地分析这些参考文献的呈现方式或质量。我们检查了来自30个问答对中1,517个参考文献,涵盖9个系统,关注它们的(1)在用户界面中的呈现方式和(2)使用CRAAP标准的质量。我们发现不同系统在参考文献的呈现方式、质量和数量方面存在显著差异。例如,ChatGPT提供更多的参考文献(平均每个响应9.5个),且质量更高(15.48/20 CRAAP评分),而Hunyuan-TurboS提供更少的参考文献(4.0)和更低的质量(11.65/20)。此外,一个初步的用户研究显示,人们很少与这些参考文献交互,并且他们的行为在不同系统之间有所不同。这些发现凸显了需要更好的界面设计,以帮助用户更有效地与参考文献交互并建立信任的必要性。
引用
@article{arxiv.2604.15326,
title = {Analyzing the Presentation, Content, and Utilization of References in LLM-powered Conversational AI Systems},
author = {Jianheng Ouyang and Arpit Narechania},
journal= {arXiv preprint arXiv:2604.15326},
year = {2026}
}
备注
8 pages, 5 figures, Accepted to ACM CHI 2026 Extended Abstract/Poster/Case Study Track