中文

分析大型语言模型聊天机器人:基于概率测试的实验方法

计算与语言 2024-07-19 v1 人工智能

摘要

本研究通过对两种不同的大型语言模型(LLM)聊天机器人(ChatGPT 和 Gemini)进行探索性测试,开展了质性实证研究。方法论程序基于设计了用于概率问题的提示语进行探索性测试。以认知心理学中广为人知的“Linda 问题”为基础,构建了本实验特有的“Mary 问题”。分析对象为每次聊天机器人交互所提供的输出数据集。分析旨在验证聊天机器人主要采用何种逻辑推理——是符合概率论的逻辑推理,还是更常受到提示语中典型文本描述的影响。研究发现提供了关于各聊天机器人在处理逻辑与文本构造方面所采取方法的见解,表明尽管所分析的聊天机器人在知名概率问题上表现令人满意,但在需要直接应用概率逻辑的新测试中表现显著低于。

关键词

引用

@article{arxiv.2407.12862,
  title  = {Analyzing Large language models chatbots: An experimental approach using a probability test},
  author = {Melise Peruchini and Julio Monteiro Teixeira},
  journal= {arXiv preprint arXiv:2407.12862},
  year   = {2024}
}

备注

17 pages, 3 figures, Submitted to ACM Transactions on Intelligent systems and Technology