中文

评估基于大语言模型的规划器中的人类信任:一项初步研究

人工智能 2025-02-28 v1 人机交互

摘要

大型语言模型 (LLM) 越来越多地被用于规划任务,具有独特的能力,如生成解释和迭代细化,这些能力在经典规划器中难以实现。然而,信任——规划系统采纳的关键因素——在基于LLM的规划任务中仍未得到充分探索。本研究通过在规划域定义语言 (PDDL) 域中的用户研究,比较了人类对基于LLM的规划器与经典规划器的信任程度。结合主观测量(如信任问卷)和客观指标(如评估准确性),我们的发现表明,正确性是信任和性能的主要驱动因素。LLM提供的解释改善了评估准确性,但对信任的影响有限;而计划细化虽未显著提升评估准确性,却有潜力增加信任。

关键词

引用

@article{arxiv.2502.20284,
  title  = {Evaluating Human Trust in LLM-Based Planners: A Preliminary Study},
  author = {Shenghui Chen and Yunhao Yang and Kayla Boggess and Seongkook Heo and Lu Feng and Ufuk Topcu},
  journal= {arXiv preprint arXiv:2502.20284},
  year   = {2025}
}