“见微知著”:LLM能否从少量解释中近似自然语言推理的人类判断分布?
计算与语言
2024-10-07 v2
摘要
人类标注变异(HLV)是一种有价值的信息来源,当多个人类标注者因合理原因提供不同标签时产生。在自然语言推理(NLI)中,先前捕捉HLV的方法要么从大量众包工作者收集标注以代表人类判断分布(HJD),要么使用专家语言学家为其选择的标签提供详细解释。前一种方法提供更密集的HJD信息,但获取过程资源密集。相比之下,后一种方法提供更丰富的文本信息,但难以扩展到众多人类评判者。此外,大型语言模型(LLM)越来越多地被用作评估者(“LLM评判者”),但结果好坏参半,且很少有工作旨在研究HJD。本研究提出利用LLM,使用少量专家标签和解释来近似HJD。我们的实验表明,无论是否包含显式标签,少量解释都能显著提高LLM近似HJD的能力,从而为扩展HJD的标注提供了一种解决方案。然而,使用LLM生成的模型判断分布(MJD)微调较小的软标签感知模型,结果部分不一致:虽然距离上相似,但由此产生的微调模型和可视化分布差异显著。我们展示了用全局形状度量和可视化来补充实例级距离度量的重要性,以便更有效地评估MJD与人类判断分布的对比。
引用
@article{arxiv.2406.17600,
title = {"Seeing the Big through the Small": Can LLMs Approximate Human Judgment Distributions on NLI from a Few Explanations?},
author = {Beiduo Chen and Xinpeng Wang and Siyao Peng and Robert Litschko and Anna Korhonen and Barbara Plank},
journal= {arXiv preprint arXiv:2406.17600},
year = {2024}
}
备注
Accepted by EMNLP 2024 Findings, 24 pages, 9 figures