何时依赖,何时不依赖?评估面向大型语言模型的合适依赖干预措施
人机交互
2025-10-30 v3
摘要
随着大型语言模型(LLM)日益融入决策流程,乐观地期待其强大能力的同时,也担忧其错误。用户可能过度依赖那些被自信地陈述却错误的LLM建议,或因不信任而低估其价值。针对LLM的依赖干预措施已被开发出来,但缺乏对合适依赖的严格评估。我们通过进行随机化在线实验,评估了三种相关干预措施的表现,实验中有400名参与者分别承担两个具有挑战性的任务:LSAT 逻辑推理和图像基准数值估计。对于每个问题,参与者首先独立作答,然后接收由三种依赖干预之一修改的LLM建议,再作答一次。我们的发现表明,干预措施虽然能减少过度依赖,但通常未能提高合适的依赖。此外,在某些情境下,人们在做出错误的依赖决策后会变得更加自信,表现出较差的校准。基于我们的发现,我们讨论了如何设计有效的LLM人类协作依赖干预措施的含义。
引用
@article{arxiv.2412.15584,
title = {To Rely or Not to Rely? Evaluating Interventions for Appropriate Reliance on Large Language Models},
author = {Jessica Y. Bo and Sophia Wan and Ashton Anderson},
journal= {arXiv preprint arXiv:2412.15584},
year = {2025}
}