中文

人群中的声音:寻找独特视角的聚类

计算与语言 2024-07-22 v1 机器学习

摘要

语言模型已被证明会再现其训练数据中存在的潜在偏见,这些偏见默认是多数视角。提出的解决方案旨在通过建模标注者分歧或基于共享元数据对标注者进行分组来捕捉少数视角,但两者都面临重大挑战。我们提出了一个框架,该框架在不编码标注者元数据的情况下训练模型,提取受标注者行为影响的潜在嵌入,并创建相似观点的聚类,我们称之为“声音”。生成的聚类通过内部和外部定量指标以及定性分析进行事后验证,以识别每个聚类所代表的声音类型。我们的结果证明了该框架强大的泛化能力,表现为生成的聚类具有足够的鲁棒性,同时还在两个不同的数据集中捕捉到了基于不同人口统计因素的少数视角。

关键词

引用

@article{arxiv.2407.14259,
  title  = {Voices in a Crowd: Searching for Clusters of Unique Perspectives},
  author = {Nikolas Vitsakis and Amit Parekh and Ioannis Konstas},
  journal= {arXiv preprint arXiv:2407.14259},
  year   = {2024}
}