RAG-Assistants寻找信息:模型规模在人类-人工智能协作中的影响
信息检索
2026-05-05 v1 人工智能
人机交互
摘要
大量研究聚焦于提高基准性能,但此类模型在真实世界人类-人工智能协作工作流程中的评估却滞后于实际应用。本工作评估了一个基于检索增强生成(RAG)的聊天机器人式助手,在灵感类似工作场所的多轮信息寻求场景中进行测试,其中需要遵守当地法规且安全处理敏感数据。具体而言,我们检验了由RAG助手帮助的人类(N=112)与仅使用大型语言模型或大型语言模型+RAG基线的性能差异。在此场景下,我们研究了底层模型规模(3B、8B和70B)如何塑造人类-人工智能协作动态,以及如何影响感知可用性和满意度。结果表明,无论模型规模如何,人类-人工智能协作的性能提升都显著高于模型单独基线,这表明在信息寻求场景中,混合系统具有优势。有趣的是,然而,参与者之间的感知可用性和满意度在不同模型规模之间几乎没有差异。这表明,在模型规模、性能和用户感知之间存在一种细致的权衡。我们的工作强调,评估AI应用在实际多轮交互中与人类用户的互动具有额外价值,关注可用性和满意度而不仅仅是准确率,而不仅仅是关注基准性能。
引用
@article{arxiv.2605.00964,
title = {Seeking Information with RAG-Assistants: Does Model Size Matter in Human-AI Collaborations?},
author = {Lennard C. Froma and Tom Kouwenhoven and Maaike H. T. de Boer and Catholijn M. Jonker and Max J. van Duijn},
journal= {arXiv preprint arXiv:2605.00964},
year = {2026}
}