对话式聊天机器人中对称推理的实证研究
计算与语言
2024-07-09 v1
摘要
本工作探讨了由大型语言模型(LLM)驱动的对话式聊天机器人理解和表征谓词对称性的能力——这是一种传统上被认为是天然人类特质的认知语言功能。利用情境学习(ICL),这是一种使聊天机器人能够从提示中学习新任务而无需重新训练的范式迁移,我们评估了五个聊天机器人的对称推理能力:ChatGPT 4、Huggingface chat AI、Microsoft 的 Copilot AI、LLaMA 通过 Perplexity 以及 Gemini Advanced。使用 Tanchip 等人(2020)提出的 Symmetry Inference Sentence(SIS)数据集,我们将聊天机器人响应与人类评估进行比较,以衡量其对谓词对称性理解程度。实验结果显示,聊天机器人之间的表现有所不同,其中一些接近人类水平的推理能力。例如,Gemini 与人类分数的相关性为 0.85,并为每一次对称性评估提供了权威的依据。这项研究凸显了 LLM 在模仿复杂认知过程方面的潜力和局限性,尤其是对称推理。
引用
@article{arxiv.2407.05734,
title = {Empirical Study of Symmetrical Reasoning in Conversational Chatbots},
author = {Daniela N. Rim and Heeyoul Choi},
journal= {arXiv preprint arXiv:2407.05734},
year = {2024}
}
备注
Accepted in Future Technology Conference (FTC) 2024