中文

主观任务中的聚合伪影导致大语言模型后验坍缩

计算与语言 2025-09-15 v4 人工智能

摘要

上下文学习已成为使用大语言模型执行自然语言任务的主要方法。预训练期间获得的知识对于这种少样本能力至关重要,它为模型提供了任务先验。然而,最近的研究表明,上下文学习主要依赖于检索任务先验,而不是“学习”执行任务。这种限制在情感和道德等复杂的主观领域尤为明显,在这些领域中,先验显著影响后验预测。在这项工作中,我们检验了这是否是相应数据集中使用的聚合的结果——试图组合低一致性的、不同的标注可能导致标注伪影,从而在提示中产生有害噪声。此外,我们通过将研究置于适当的、定量的LLM先验度量中,评估了后验对某些标注者的偏向。我们的结果表明,聚合是主观任务建模中的一个混淆因素,并主张转而关注对个体进行建模。然而,聚合并不能解释上下文学习与最先进技术之间的全部差距,这意味着此类任务中的其他因素也导致了观察到的现象。最后,通过严格研究标注者级别的标签,我们发现少数派标注者既有可能更好地与LLM对齐,也有可能使其观点被进一步放大。

关键词

引用

@article{arxiv.2410.13776,
  title  = {Aggregation Artifacts in Subjective Tasks Collapse Large Language Models' Posteriors},
  author = {Georgios Chochlakis and Alexandros Potamianos and Kristina Lerman and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:2410.13776},
  year   = {2025}
}

备注

16 pages, 12 figures, 3 tables