ChatGPT 像人类一样评估自然语言解释质量:但在哪些量表上?
计算与语言
2024-03-27 v1 人工智能
摘要
随着人工智能在我们的生活中变得更加不可或缺,对透明度和责任的需求也在增长。虽然自然语言解释(NLEs)对于阐明 AI 决策背后的推理至关重要,但由于主观性和对细粒度评分的需求,通过人类判断来评估它们是复杂且资源密集的。本研究探讨了 ChatGPT 与人类评估在多个量表(即二元、三元和 7 点李克特量表)上的一致性。我们从三个 NLE 数据集中抽取了 300 个数据实例,并为信息量和清晰度评分收集了 900 个人类标注,作为文本质量度量。我们进一步在不同主观性评分范围内进行了配对比较实验,其基线来自 8,346 个人类标注。我们的结果表明,ChatGPT 在更粗粒度的量表上与人类的一致性更好。此外,配对比较和动态提示(即在提示中提供语义相似的示例)改善了一致性。这项研究推进了我们对大型语言模型在不同配置下评估文本解释质量能力的理解,以促进负责任的人工智能发展。
引用
@article{arxiv.2403.17368,
title = {ChatGPT Rates Natural Language Explanation Quality Like Humans: But on Which Scales?},
author = {Fan Huang and Haewoon Kwak and Kunwoo Park and Jisun An},
journal= {arXiv preprint arXiv:2403.17368},
year = {2024}
}
备注
Accpeted by LREC-COLING 2024 main conference, long paper