跨越鸿沟:用于建模人类不同意见的情境学习
计算与语言
2025-06-09 v1
摘要
大型语言模型(LLM)在NLP分类任务中表现出强大的性能,但通常依赖于聚合标签——通过多数投票等方式——这可能会掩盖主观标注中固有的human disagreement。本研究考察了LLM是否能够捕捉多个视角并反映标注者在主观任务(如仇恨言论和冒犯性语言检测)中的不同意见。我们采用零shot和fewshot情境学习(in-context learning, ICL),评估了四个开源LLM,基于三种标签建模策略:聚合硬标签、分解硬标签和软标签。在fewshot情境学习中,我们评估了基于文本相似性(BM25、基于PLM的方法)、标注 disagreement(entropy)、组合排名以及示例排序策略(随机 vs. 基于课程的方法)的 demonstration selection 方法。结果表明,multi-perspective generation在零shot情境中是可行的,而fewshot设置往往难以捕捉人类判断的完整光谱。提示词设计和 demonstration selection 对性能影响显著,但示例排序效果有限。这些发现凸显了使用LLM处理主观性任务的挑战,以及构建更具视角意识和社会智能模型的重要性。
引用
@article{arxiv.2506.06113,
title = {Bridging the Gap: In-Context Learning for Modeling Human Disagreement},
author = {Benedetta Muscato and Yue Li and Gizem Gezici and Zhixue Zhao and Fosca Giannotti},
journal= {arXiv preprint arXiv:2506.06113},
year = {2025}
}