中文

检测大型语言模型错误中的人类因素:系统文献综述与未来研究方向

计算与语言 2024-03-18 v1 人工智能 机器学习

摘要

2022年11月,OpenAI 发布 ChatGPT 标志着人工智能领域的转折点,引入了大型语言模型 (LLM) 到主流,并创下了用户采纳记录。LLM,特别是 ChatGPT,训练于广泛的互联网数据,展现出在 various 领域的惊人对话能力,表明其对 workforce 将产生重大影响。然而,这些模型容易出错——“幻觉”和遗漏,生成错误或不完整的信息。这在 accuracy 至关重要的情境中尤其具有风险,如法律合规、医疗或细致的流程框架。既有 technical 也有人类解决方案来应对这一问题。本文探讨了 enable users 检测 LLM 输出中错误的人类因素,这是缓解其在专业环境中使用的风险的关键组件。理解这些因素对于旨在高效利用 LLM 技术的组织至关重要,指导针对性训练和部署策略以提高用户的错误检测能力。这种方法不仅旨在优化 LLM 的使用,还旨在防止因依赖不准确的模型响应而产生的潜在下游问题。本研究强调了技术进步与人类洞察力之间的平衡,以最大化 LLM 的好处,同时最小化风险,尤其是在 precision 至关重要的领域。本文对该研究主题进行系统文献检索,分析和综合了 findings,并提出了未来研究方向。文献选择的截止日期为2024年1月11日。

关键词

引用

@article{arxiv.2403.09743,
  title  = {The Human Factor in Detecting Errors of Large Language Models: A Systematic Literature Review and Future Research Directions},
  author = {Christian A. Schiller},
  journal= {arXiv preprint arXiv:2403.09743},
  year   = {2024}
}

备注

21 papers analysed and synthesized in detail from a total search result size of 594 (raw results) / 61 (scanned) / 28 (selected)