中文

为何及何时基于大语言模型的助手会出错:探究基于提示的交互在软件求助中的有效性

人机交互 2024-02-14 v1 人工智能 机器学习

摘要

大语言模型(LLM)助手(如 ChatGPT)已成为帮助用户导航复杂、功能丰富软件的搜索方法的潜在替代方案。LLM 利用来自领域特定文本、软件手册和代码仓库的海量训练数据来模拟类人交互,提供包括分步指导在内的定制化协助。在本研究中,我们通过一项包含 16 名参与者的受试者内实验及后续访谈,调查了 LLM 生成的软件指导效果。我们将基线 LLM 助手与针对特定软件环境优化的 LLM(SoftAIBot)进行了对比,后者还提供了构建适当提示的指南。我们评估了任务完成率、感知准确性、相关性和信任度。令人惊讶的是,尽管 SoftAIBot 的表现优于基线 LLM,但我们的结果显示,无论是否提供提示指南或整合领域上下文,在 LLM 的使用情况和用户感知方面均无显著差异。大多数用户难以理解提示文本与 LLM 响应之间的关系,并且往往逐字遵循 LLM 的建议,即使这些建议是错误的。这导致在使用 LLM 建议执行软件任务时遇到困难,从而造成较低的任务完成率。我们的详细分析还显示,用户并未意识到 LLM 响应中的不准确之处,表明其软件专业知识的缺乏与评估 LLM 协助能力之间存在差距。随着设计领域特定 LLM 助手的推动力度不断加大,我们强调在 LLM 中融入可解释的、上下文感知的线索的重要性,以帮助用户理解基于提示的交互、识别偏见并最大化 LLM 助手的效用。

关键词

引用

@article{arxiv.2402.08030,
  title  = {Why and When LLM-Based Assistants Can Go Wrong: Investigating the Effectiveness of Prompt-Based Interactions for Software Help-Seeking},
  author = {Anjali Khurana and Hari Subramonyam and Parmit K Chilana},
  journal= {arXiv preprint arXiv:2402.08030},
  year   = {2024}
}

备注

Accepted for publication in the Proceedings of the 29th International Conference on Intelligent User Interfaces (IUI'24), March 18--21, 2024, in Greenville, SC, USA