中文

利用人口统计感知专家与合成视角建模标注者分歧

计算与语言 2025-11-06 v3

摘要

我们通过架构和数据驱动的双重创新,提出了一种在主观 NLP 任务中建模标注者分歧的方法。我们的模型 DEM-MoE(Demographic-Aware Mixture of Experts,人口统计感知混合专家)根据标注者的人口统计特征将输入路由至专家子网络,使其能够比先前模型更好地表示结构化的群体层面差异。DEM-MoE 在不同人口统计群体中始终表现良好,并在标注者分歧较高的数据集上表现出尤为优异的结果。为解决人口统计覆盖稀疏的问题,我们测试了是否可以通过零样本角色提示生成的 LLM 合成标注来进行数据插补。我们表明,这些合成判断在我们的数据上与人类标注具有中等程度的良好一致性,并提供了一种可扩展的方式来潜在丰富训练数据。随后,我们提出并评估了使用针对数据集结构量身定制的策略来融合真实数据与合成数据的方法。我们发现,最优策略取决于数据集结构。这些贡献共同提升了对多样化视角的表示能力。

关键词

引用

@article{arxiv.2508.02853,
  title  = {Modeling Annotator Disagreement with Demographic-Aware Experts and Synthetic Perspectives},
  author = {Yinuo Xu and Veronica Derricks and Allison Earl and David Jurgens},
  journal= {arXiv preprint arXiv:2508.02853},
  year   = {2025}
}

备注

8 pages, 17 figures