注释者身份特征对大语言模型行为在主体主义谱系中的影响
计算与语言
2025-08-26 v1
摘要
本文探讨了大型语言模型(LLM)在考虑注释者身份特征并纳入强到弱数据主体主义谱系中,对仇恨言语和滥用内容进行注释的能力。我们对比评估了 LLM 生成的注释与现有注释者建模技术的效果,进行了针对不同视角建模的评估。我们的发现表明,LLM 会选择性地使用身份特征中的人口统计学属性。我们识别出原型注释者,其中一些身份特征显示出与原始人类注释者不同程度的一致性。在数据主体主义范式下,未显式依赖注释者信息的注释者建模技术在弱数据主体主义下表现优于强数据主体主义和人类注释者,表明 LLM 生成的观点倾向于聚合,尽管存在主观提示。然而,对于更个性化的针对强主体主义的数据集,LLM 注释者建模的性能接近甚至未超过人类注释者。
引用
@article{arxiv.2508.17164,
title = {The Impact of Annotator Personas on LLM Behavior Across the Perspectivism Spectrum},
author = {Olufunke O. Sarumi and Charles Welch and Daniel Braun and Jörg Schlötterer},
journal= {arXiv preprint arXiv:2508.17164},
year = {2025}
}
备注
Accepted at ICNLSP 2025, Odense, Denmark