大学学生报纸中的无监督偏见检测
计算与语言
2023-09-14 v1 人工智能
机器学习
摘要
本文提出了一种具有最小人工干预的流水线,用于抓取并检测大学报纸档案中的偏见。本文引入了一个用于抓取复杂档案站点的框架,这些站点自动化工具无法抓取数据,随后生成了一个包含 14 份学生报纸、共 23,154 条条目的数据集。该数据随后可按关键词查询,通过将大语言模型摘要的情感与原文章进行比较来计算偏见。该方法的优势在于其比重构偏见更具可比性,且比生成关键词情感所需标注数据更少。结果基于政治敏感词与控制词计算,以展示如何得出结论。完整方法以最小假设与分类促进了细致洞察的提取,为更客观地理解学生报纸来源中的偏见铺平了道路。
引用
@article{arxiv.2309.06557,
title = {Unsupervised Bias Detection in College Student Newspapers},
author = {Adam M. Lehavi and William McCormack and Noah Kornfeld and Solomon Glazer},
journal= {arXiv preprint arXiv:2309.06557},
year = {2023}
}
备注
7 pages, 5 figures, 3 tables, submitted to AAAI2024