“是 ChatGPT 比我的教授更好的解释者吗?”:在对话中评估大语言模型的解释能力与人类基准的比较
计算与语言
2024-06-27 v1
摘要
解释是知识共享的基础,依赖于交流原则、社会动态和学习理论。我们特别关注面向解释的对话方法,因为情境具有高度的自适应性和互动性。我们的研究利用了关于解释行为的前期工作,后者提供了一种理解解释者和被解释者在对话中所采取的不同策略的框架,以进行解释、理解和与对方互动。我们使用由 Wachsmuth 等人于 2023 年从 WIRED YouTube 系列中构建的 5-Levels 数据集,后由 Booshehri 等人进行注释。这些注释提供了理解解释者和被解释者在构建响应时所采取的结构化方式的框架。鉴于过去一年中生成式 AI 的兴起,我们希望更好地了解大语言模型 (LLM) 的能力,以及它们如何在对话环境中增强专家解释者的能力。为实现这一目标,5-Levels 数据集(我们使用 Booshehri 等人 2023 年注释的数据集)允许我们审计 LLM 在进行解释对话中的能力。为评估 LLM 在生成解释响应方面的效果,我们比较了 3 种不同策略:我们要求人类标注员评估 3 种不同策略:人类解释者响应、GPT-4 标准响应、GPT-4 带解释动作响应。
引用
@article{arxiv.2406.18512,
title = {"Is ChatGPT a Better Explainer than My Professor?": Evaluating the Explanation Capabilities of LLMs in Conversation Compared to a Human Baseline},
author = {Grace Li and Milad Alshomary and Smaranda Muresan},
journal= {arXiv preprint arXiv:2406.18512},
year = {2024}
}
备注
6 figures, 5 pages